İçeriğe geç

LLMTR Gemma 4 (Türkiye)

Gemma 4, Türkiye'de kendi donanımımızda barındırdığımız birinci taraf modelidir. llmtr/gemma-4 canonical model kimliği ile /v1/chat/completions üzerinden çağrılır. İstekler üçüncü taraf bir sağlayıcıya yönlendirilmez; veri egemenliği gerektiren kurum içi yardımcılar, doküman analizi ve araç kullanan ajan akışları için uygundur.

ÖzellikDeğer
Model kimliğillmtr/gemma-4
Alttaki modelGemma 4 26B-A4B-IT
Bağlam penceresi131.072 token (128K)
Fiyat (input / output / cache read)2.00 / 5.00 / 0.50 $ per 1M token
Görsel girdiVar (yalnızca base64 data URL)
Araç çağırmaVar
Prompt cacheVar
Düşünme (reasoning)Var, opsiyonel — varsayılan kapalı
Ses / video girdisiYok
Görsel üretimiYok
Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "llmtr/gemma-4",
"messages": [
{ "role": "user", "content": "Bu sozlesme maddesini sade Turkce ile ozetle." }
],
"max_tokens": 1024
}'

Varsayılan olarak model düşünmeden yanıtlar; düşünme tokenı harcanmaz. Adım adım akıl yürütme gereken işlerde iki yoldan biriyle açabilirsiniz:

{ "model": "llmtr/gemma-4:think", "messages": [{ "role": "user", "content": "Bu mantik bulmacasini coz." }] }
{ "model": "llmtr/gemma-4", "reasoning": true, "messages": [{ "role": "user", "content": "Bu mantik bulmacasini coz." }] }

Kapatmak için :fast seçicisini veya reasoning: false değerini kullanın. Düşünme açıkken üretilen akıl yürütme message.reasoning_content alanında döner ve max_tokens bütçenizden harcanarak çıktı olarak faturalanır. Çok küçük bir max_tokens değerinde bütçe düşünmede tükenebilir ve content boş dönebilir.

Model görselleri okur, ancak görseli yalnızca base64 data URL olarak kabul eder. Uzak bir https:// adresi gönderirseniz istek 400 unsupported_input döner.

{
"model": "llmtr/gemma-4",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Bu gorselde ne var?" },
{
"type": "image_url",
"image_url": { "url": "data:image/png;base64,iVBORw0KGgo..." }
}
]
}
],
"max_tokens": 1024
}

Görsel tokenları normal input tokenı olarak faturalanır; ayrı bir görsel tarifesi yoktur.

Model standart OpenAI tools şemasını destekler ve gerçek tool_calls döndürür:

{
"choices": [
{
"message": {
"role": "assistant",
"content": "",
"tool_calls": [
{
"id": "call_1",
"type": "function",
"function": { "name": "get_weather", "arguments": "{\"city\":\"Istanbul\"}" }
}
]
},
"finish_reason": "tool_calls"
}
]
}

Tekrar eden istem başlangıçları önbellekten karşılanır. Önbellekten gelen tokenlar prompt_tokens_details.cached_tokens alanında raporlanır ve input yerine cache read tarifesinden faturalanır:

"usage": {
"prompt_tokens": 1603,
"completion_tokens": 2,
"prompt_tokens_details": { "cached_tokens": 1579 }
}

Bu örnekte 1579 token 0.50 $/1M, kalan 24 token 2.00 $/1M üzerinden ücretlendirilir.

Üretim hızı saniyede yaklaşık 30-45 tokendir; 128K bağlam penceresi uzun dokümanlarla pratikte kullanılabilir. İstemci tarafında:

  • Uzun çıktılarda stream: true kullanın ve istemci okuma zaman aşımınızı en az 120 saniye tutun. Çoğu HTTP istemcisinin 60 saniyelik varsayılanı uzun yanıtlarda yetersiz kalır.
  • Aynı öneki (sistem talimatı, doküman, konuşma geçmişi) tekrar gönderin: önek önbelleğe alınır, yanıt belirgin şekilde hızlanır ve önbellekten okunan tokenlar daha ucuz faturalanır.
  • Yoğun dönemlerde yanıt süresi uzayabilir; okuma zaman aşımını dar tutmayın.

Ayrıntı için Zaman aşımları ve yavaş modeller sayfasına bakın.