İçeriğe geç

GPT-6 Sol ve Luna

openai/gpt-6-sol ve openai/gpt-6-luna, GPT-6 Astra'nın güçlü yönlerini daha hızlı ve daha düşük maliyetli modellere taşıyan GPT-6 modelleridir. Sol akıl yürütme ağırlıklı işler için, Luna hızlı yanıt ve yüksek hacim için optimize edilmiştir.

Model Bağlam Çıktı Girdiler
openai/gpt-6-sol 1.050.000 128.000 Metin, görsel, PDF
openai/gpt-6-luna 1.050.000 128.000 Metin, görsel, PDF

Ses girdisi desteklenmez; ses içeren bir istek reddedilir.

  • Sol: zor akıl yürütme, ajan tabanlı kodlama, araç kullanan çok adımlı akışlar ve uzun bağlamlı analiz.
  • Luna: asistanlar, sınıflandırma, özetleme, bilgi çıkarma ve yönlendirme gibi hacimli ve maliyet hassas işler.
  • En zor uçtan uca işler için GPT-6 Astra kullanılır.

Fiyatlar 1 milyon token başınadır ve OpenAI'nin liste fiyatıdır. Model fiyatlarına marj eklenmez.

Model Giriş / Cache okuma / Çıkış ($/1M)
openai/gpt-6-sol 2,00 / 0,20 / 10,00
openai/gpt-6-luna 0,10 / 0,01 / 0,50

GPT-6 ailesinde prompt cache'e yazma ücretsiz değildir: cache yazma tarifesi giriş fiyatının 1,25 katıdır. GPT-5.6 ve önceki OpenAI modellerinde yazma ücretsizdi.

Tutarlar 1 milyon token başına USD'dir:

Metrik Sol Sol, 272K token üzeri Luna Luna, 272K token üzeri
Giriş 2,00 4,00 0,10 0,20
Cache okuma 0,20 0,40 0,01 0,02
Cache yazma 2,50 5,00 0,125 0,25
Çıkış 10,00 15,00 0,50 0,75

Cache'e yazılan tokenlar giriş tokenlarının bir alt kümesidir, üstüne eklenmez: soğuk bir istekte prompt'un önek kısmı cache'e yazılır ve o kısım giriş yerine cache yazma tarifesinden faturalanır. Aynı önekle gelen sonraki isteklerde aynı tokenlar cache okuma tarifesinden, yani giriş fiyatının onda birinden faturalanır. Kullanım kayıtlarınızda cache yazma ve cache okuma ayrı kalemler olarak görünür.

Girdisi 272.000 tokenı aşan isteklerde isteğin tamamı uzun bağlam sütunlarından faturalanır: giriş ve cache tarifeleri iki katına, çıkış tarifesi 1,5 katına çıkar.

Terminal window
curl "$LLMTR_BASE_URL/v1/responses" \
-H "Authorization: Bearer $LLMTR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-6-sol",
"input": "Bu servisin hata yönetimindeki eksikleri sırala.",
"max_output_tokens": 1024
}'

Modeller /v1/chat/completions üzerinden de çağrılabilir; yanıt OpenAI sohbet formatında döner. Araç tanımlarını akıl yürütme seviyesiyle birlikte bu uçtan da gönderebilirsiniz:

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer $LLMTR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-6-luna",
"reasoning_effort": "low",
"messages": [
{ "role": "user", "content": "İstanbul için hava durumunu getir." }
],
"tools": [
{
"type": "function",
"function": {
"name": "get_weather",
"parameters": {
"type": "object",
"properties": { "city": { "type": "string" } },
"required": ["city"]
}
}
}
]
}'

İki model de altı seviye kabul eder: none, low, medium, high, xhigh ve max. Varsayılan medium'dur. none akıl yürütmeyi kapatır. minimal kabul edilmez; gönderilirse gateway 400 döner.

{
"model": "openai/gpt-6-sol",
"reasoning_effort": "max",
"input": "Bu eşzamanlılık hatasının kök nedenini bul.",
"max_output_tokens": 4096
}

Seviye üç yoldan verilebilir; öncelik sırası reasoning_effort > reasoning.effort > slug suffix'idir. :max suffix'i bu modellerde gerçek max seviyesine çözülür:

openai/gpt-6-luna:none -> reasoning effort = none
openai/gpt-6-sol:max -> reasoning effort = max

Akıl yürütme tokenları çıktı tarifesinden faturalanır. Yüksek seviyelerde max_output_tokens değerini düşük tutarsanız bütçe akıl yürütmede tükenip yanıt metni boş kalabilir. Ayrıntılar için Reasoning Effort sayfasına bakın.

temperature ve top_p bu modellerde desteklenmez. Gateway bu alanları isteğe eklenmişse reddetmek yerine çıkarır ve yanıtta llmtr_dropped_parameters alanıyla bildirir.

service_tier alanı (priority, flex) uygulanmaz: istek standart katmanda çalışır ve yukarıdaki standart fiyattan faturalanır. Alan gövdeden çıkarılır ve yanıtta llmtr_dropped_parameters içinde bildirilir.

İçerik dizisinde görsel veya PDF gönderebilirsiniz:

{
"model": "openai/gpt-6-luna",
"input": [
{
"role": "user",
"content": [
{ "type": "input_text", "text": "Bu fişteki toplam tutarı çıkar." },
{ "type": "input_image", "image_url": "data:image/png;base64,..." }
]
}
],
"max_output_tokens": 1024
}

Görsel tokenları giriş tarifesinden faturalanır.

Fonksiyon çağrısı, paralel çağrı, tool_choice: "required" ve strict: true ile json_schema desteklenir. Ortak istek biçimi için Tool Calling sayfasına bakın.

Modeller akışı destekler. Akışın son karesi tam usage bloğunu, cache yazma sayısı dahil, taşır; faturalama akışta da gerçek token sayımıyla yapılır. Ayrıntılar: Streaming.