İçeriğe geç

Qwen3.8 2.4T A95B

Qwen3.8 2.4T A95B, Qwen3.8 neslinin açık ağırlıklı sürümüdür: 2,4 trilyon parametrenin token başına 95 milyarı çalışan seyrek bir Mixture-of-Experts modeli. Kod yazma, araştırma ve uzun soluklu ajan akışları için tasarlanmıştır.

ModelBağlamGiriş / Çıkış ($/1M)Önbellekli giriş ($/1M)
qwen/qwen3.8-2.4t-a95b262.1442,00 / 6,000,20
Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen/qwen3.8-2.4t-a95b",
"messages": [
{ "role": "user", "content": "Bu fonksiyondaki yarış koşulunu bul." }
],
"max_tokens": 8192
}'

Katalogda aynı nesilden iki ayrı satır var ve ikisi birbirinin yerine geçmez:

qwen/qwen3.8-2.4t-a95bqwen/qwen3.8-max
SürümAçık ağırlıkKapalı, sağlayıcı barındırmalı
Bağlam262.1441.000.000
Girdi türleriYalnızca metinMetin, görsel, video
Düşünmeyi kapatmaYokVar
Giriş / Çıkış ($/1M)2,00 / 6,002,00 / 6,00

Model kimliğini açıkça yazın; biri diğerine yönlendirilmez.

Model yanıt vermeden önce adım adım düşünür ve düşünce zincirini reasoning_content alanında ayrı döndürür. content nihai cevabı taşır.

Bu davranış kapatılamaz. Düşünmeyi kapatmaya çalışan istekler sağlayıcı tarafından reddedilir. Diğer bazı modellerde çalışan :fast soneki, "reasoning": false ve benzeri denetimler bu modelde düşünmeyi susturmaz.

Pratik sonucu: düşünme tokenları da çıktıdır ve completion_tokens içinde faturalanır. Kısa bir soru bile birkaç yüz token düşünme harcayabilir, bu yüzden max_tokens değerini bol tutun. Düşük kalırsa bütçe düşünme sırasında tükenir ve elinizde boş bir content ile finish_reason: "length" kalır.

Sağlayıcı yedi seviyeyi kabul ediyor gibi görünse de seviyelerin ölçülebilir bir etkisi yoktur: aynı istem üzerinde xhigh seviyesi none seviyesinden daha kısa düşünme üretebiliyor ve tek bir seviyenin kendi tekrarları arasındaki fark, seviyeler arasındaki farktan büyük.

Çalışmayan bir denetimi sunmak yerine LLMTR bu parametreyi 400 ile reddeder. Seviyeli denetimi gerçekten uygulayan modeller için Reasoning Effort sayfasına bakın.

Araç çağrısı yereldir. tool_choice alanının auto, required ve adlandırılmış fonksiyon biçimlerinin üçü de çalışır; dönen tool_calls argümanları geçerli JSON'dur.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen/qwen3.8-2.4t-a95b",
"messages": [{ "role": "user", "content": "12345 numaralı siparişi getir." }],
"tools": [{
"type": "function",
"function": {
"name": "lookup_order",
"description": "Sipariş numarasına göre sipariş getirir",
"parameters": {
"type": "object",
"properties": { "orderId": { "type": "string" } },
"required": ["orderId"]
}
}
}],
"tool_choice": "auto"
}'

Araç sonucunu role: "tool" mesajıyla geri besleyip konuşmaya devam edebilirsiniz. Ayrıntı için Araç Çağrısı sayfasına bakın.

response_format alanı hem json_object hem json_schema biçimini kabul eder:

{
"response_format": {
"type": "json_schema",
"json_schema": {
"name": "capital",
"schema": {
"type": "object",
"properties": {
"country": { "type": "string" },
"capital": { "type": "string" }
},
"required": ["country", "capital"]
}
}
}
}

Tekrarlanan istem önekleri otomatik olarak önbelleğe alınır; ayrı bir parametre göndermenize gerek yoktur. Önbellek ilk çağrıda ısınır, sonraki çağrılarda isabet eder.

Önbellekten okunan tokenlar usage.prompt_tokens_details.cached_tokens alanında raporlanır ve giriş fiyatı yerine 1M başına 0,20 dolardan faturalanır — yani normal giriş fiyatının onda biri.

Ölçülen örnek: 19.627 tokenlık aynı önek ikinci çağrıda 17.952 token önbellekten geldi. Uzun ve sabit bir sistem istemiyle çalışıyorsanız, o öneki her istekte birebir aynı tutmak maliyeti belirgin şekilde düşürür.

  • Bağlam 262.144 token. Giriş ve çıkış toplamı bunu aşarsa istek 400 ile reddedilir.
  • Ayrı bir çıktı tavanı yoktur. max_tokens için bağlam penceresi dışında bir sınır uygulanmaz.
  • Yalnızca metin. Görsel, ses veya video girdisi kabul edilmez; görsel içeren istekler reddedilir.

Bu model yurt dışındaki üçüncü taraf altyapı üzerinde çalışır. İstemler ve tamamlamalar sağlayıcı tarafından günlüğe kaydedilebilir. Türkiye'de barındırılan bir LLMTR modeli değildir. Türkiye'de barındırılan modeller için LLMTR Qwen sayfasına bakın.