İçeriğe geç

Gemma 4 26B A4B

Gemma 4 26B A4B, Google'ın Gemma 4 ailesindeki açık ağırlıklı Mixture-of-Experts modelidir: 25,2 milyar parametresinin token başına yalnızca 3,8 milyarını çalıştıran seyrek bir mimari, bu da ona çok daha büyük bir model kapasitesiyle birlikte hızlı çıkarım sağlar. gemma/gemma-4-26b-a4b-it canonical model kimliği ile /v1/chat/completions üzerinden çağrılır.

ModelBağlamGiriş / Çıkış ($/1M)
gemma/gemma-4-26b-a4b-it262.1440,07 / 0,34
Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "gemma/gemma-4-26b-a4b-it",
"messages": [
{ "role": "user", "content": "RAM tasarrufu hakkında kısa bir şaka yaz." }
],
"max_tokens": 512
}'

Model isterse yanıt vermeden önce adım adım düşünebilir, ancak bu varsayılan olarak kapalıdır. Düz bir istekte content doğrudan nihai yanıtı taşır, ayrı bir düşünme izi dönmez.

Düşünmeyi açmak için isteğe reasoning: true ekleyin veya :think suffix'ini kullanın:

{ "model": "gemma/gemma-4-26b-a4b-it:think", "messages": [{ "role": "user", "content": "17 çarpı 23 kaçtır?" }], "max_tokens": 1024 }
// Veya istek gövdesinde reasoning alanı
{ "model": "gemma/gemma-4-26b-a4b-it", "reasoning": true, "messages": [{ "role": "user", "content": "17 çarpı 23 kaçtır?" }], "max_tokens": 1024 }

Düşünme açıkken yanıt message.reasoning_content alanında ayrı bir düşünme izi taşır; content yine yalnızca nihai cevabı içerir. Düşünme tokenları completion_tokens içinde sayılır ve çıktı olarak faturalanır, bu yüzden düşünmeyi açtığınızda max_tokens değerini bol tutun.

Model metin ve görseli birlikte kabul eder, yalnızca metin üretir. Görseli base64 veri URL'si olarak gönderin:

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "gemma/gemma-4-26b-a4b-it",
"messages": [{
"role": "user",
"content": [
{ "type": "text", "text": "Bu görüntüde ne var?" },
{ "type": "image_url", "image_url": { "url": "data:image/png;base64,<base64>" } }
]
}]
}'

Ses ve video girdisi desteklenmez.

Araç çağrısı yereldir. tool_choice alanının auto, required ve adlandırılmış fonksiyon biçimlerinin üçü de çalışır; dönen tool_calls argümanları geçerli JSON'dur. Ayrıntı için Araç Çağrısı sayfasına bakın.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "gemma/gemma-4-26b-a4b-it",
"messages": [{ "role": "user", "content": "İstanbulda hava nasıl?" }],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"description": "Bir şehrin güncel hava durumunu getirir",
"parameters": {
"type": "object",
"properties": { "city": { "type": "string" } },
"required": ["city"]
}
}
}],
"tool_choice": "auto"
}'

response_format alanı hem json_object hem json_schema biçimini kabul eder:

{
"response_format": {
"type": "json_schema",
"json_schema": {
"name": "capital",
"schema": {
"type": "object",
"properties": {
"country": { "type": "string" },
"capital": { "type": "string" }
},
"required": ["country", "capital"]
}
}
}
}
  • Bağlam penceresi 262.144 token (resmi model kartları ve canlı ölçümle doğrulandı).
  • Ayrı bir çıktı tavanı yoktur. max_tokens için bağlam penceresi dışında bir sınır uygulanmaz; gateway bu isteği ayrıca 400 ile reddetmez.
  • Prompt cache yoktur. Tekrarlanan istem önekleri indirimli faturalanmaz.
  • Ses ve video girdisi desteklenmez.