İçeriğe geç

Gemma 4 26B A4B

Gemma 4 26B A4B, Google'ın Gemma 4 ailesindeki açık ağırlıklı Mixture-of-Experts modelidir: 25,2 milyar parametresinin token başına yalnızca 3,8 milyarını çalıştıran seyrek bir mimari, bu da ona çok daha büyük bir model kapasitesiyle birlikte hızlı çıkarım sağlar. gemma/gemma-4-26b-a4b-it canonical model kimliği ile /v1/chat/completions üzerinden çağrılır.

ModelBağlamGiriş / Çıkış ($/1M)
gemma/gemma-4-26b-a4b-it131.0720,042 / 0,22
Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "gemma/gemma-4-26b-a4b-it",
"messages": [
{ "role": "user", "content": "RAM tasarrufu hakkında kısa bir şaka yaz." }
],
"max_tokens": 512
}'

Model isterse yanıt vermeden önce adım adım düşünebilir, ancak bu varsayılan olarak kapalıdır. Düz bir istekte content doğrudan nihai yanıtı taşır, ayrı bir düşünme izi dönmez.

Düşünmeyi açmak için isteğe reasoning: true ekleyin veya :think suffix'ini kullanın:

{ "model": "gemma/gemma-4-26b-a4b-it:think", "messages": [{ "role": "user", "content": "17 çarpı 23 kaçtır?" }], "max_tokens": 1024 }
// Veya istek gövdesinde reasoning alanı
{ "model": "gemma/gemma-4-26b-a4b-it", "reasoning": true, "messages": [{ "role": "user", "content": "17 çarpı 23 kaçtır?" }], "max_tokens": 1024 }

Düşünme açıkken yanıt message.reasoning_content alanında ayrı bir düşünme izi taşır; content yine yalnızca nihai cevabı içerir. Düşünme tokenları completion_tokens içinde sayılır ve çıktı olarak faturalanır, bu yüzden düşünmeyi açtığınızda max_tokens değerini bol tutun.

Model metin ve görseli birlikte kabul eder, yalnızca metin üretir. Görseli base64 veri URL'si olarak gönderin:

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "gemma/gemma-4-26b-a4b-it",
"messages": [{
"role": "user",
"content": [
{ "type": "text", "text": "Bu görüntüde ne var?" },
{ "type": "image_url", "image_url": { "url": "data:image/png;base64,<base64>" } }
]
}]
}'

Ses ve video girdisi desteklenmez.

Araç çağrısı yereldir. tool_choice alanının auto, required ve adlandırılmış fonksiyon biçimlerinin üçü de çalışır; dönen tool_calls argümanları geçerli JSON'dur. Ayrıntı için Araç Çağrısı sayfasına bakın.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "gemma/gemma-4-26b-a4b-it",
"messages": [{ "role": "user", "content": "İstanbulda hava nasıl?" }],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"description": "Bir şehrin güncel hava durumunu getirir",
"parameters": {
"type": "object",
"properties": { "city": { "type": "string" } },
"required": ["city"]
}
}
}],
"tool_choice": "auto"
}'

response_format alanı hem json_object hem json_schema biçimini kabul eder:

{
"response_format": {
"type": "json_schema",
"json_schema": {
"name": "capital",
"schema": {
"type": "object",
"properties": {
"country": { "type": "string" },
"capital": { "type": "string" }
},
"required": ["country", "capital"]
}
}
}
}

Bu model Türkiye'de barındırılmaz. İstekler yurt dışındaki üçüncü taraf bir altyapı üzerinde işlenir; istemler ve tamamlamalar sağlayıcı tarafından günlüğe kaydedilebilir.

  • Bağlam penceresi 131.072 token (canlı ölçümle doğrulandı).
  • Ayrı bir çıktı tavanı yoktur, bütçe paylaşımlıdır. İstem ve yanıt aynı 131.072 tokenlik bütçeyi paylaşır; bağlam penceresinin altında max_tokens için ayrı bir üst sınır uygulanmaz. İki farklı istem boyutuyla ölçüldü: kabul edilen en büyük max_tokens, istem büyüdükçe tam da o kadar küçülür.
  • Sınıra usage.prompt_tokens ile hizalanmayın, pay bırakın. Sağlayıcı isteği kabul edip etmeyeceğine kendi istem sayımıyla karar veriyor ve bu sayım, aynı istek için sonradan raporladığı usage.prompt_tokens değerinden büyük olabiliyor: 2026-08-24 ölçümünde usage 4.023 token bildirirken sınır hesabı 5.011 token üzerinden yapıldı. Bu yüzden max_tokens değerini raporlanan sayıya göre tam 131.072'ye oturtan bir istek beklenmedik şekilde reddedilebilir; toplamı hedefliyorsanız birkaç bin tokenlik pay bırakın.
  • Bütçeyi aşan istek 400 değil 429 döner. Reddi veren gateway değil sağlayıcıdır ve gövdesinde exceeds its 131072-token context window yazar. Aynı sağlayıcı geçici yavaşlık ve kota için de 429 kullanır; bu iki durum retry after Ns taşır ve tekrar denendiğinde geçer, boyut reddi ise geçmez.
  • Prompt cache yoktur. Canlı ölçümlere göre tekrarlanan istem önekleri için ayrı bir önbellek indirimi uygulanmamaktadır.
  • Ses ve video girdisi desteklenmez.