LLMTR Gemma 4 (Türkiye)
Gemma 4, Türkiye'de kendi donanımımızda barındırdığımız birinci taraf modelidir. llmtr/gemma-4 canonical model kimliği ile /v1/chat/completions üzerinden çağrılır. İstekler üçüncü taraf bir sağlayıcıya yönlendirilmez; veri egemenliği gerektiren kurum içi yardımcılar, doküman analizi ve araç kullanan ajan akışları için uygundur.
| Özellik | Değer |
|---|---|
| Model kimliği | llmtr/gemma-4 |
| Alttaki model | Gemma 4 26B-A4B-IT |
| Bağlam penceresi | 131.072 token (128K) |
| Fiyat (input / output / cache read) | 2.00 / 5.00 / 0.50 $ per 1M token |
| Görsel girdi | Var (yalnızca base64 data URL) |
| Araç çağırma | Var |
| Prompt cache | Var |
| Düşünme (reasoning) | Var, opsiyonel — varsayılan kapalı |
| Ses / video girdisi | Yok |
| Görsel üretimi | Yok |
curl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "llmtr/gemma-4", "messages": [ { "role": "user", "content": "Bu sozlesme maddesini sade Turkce ile ozetle." } ], "max_tokens": 1024 }'Düşünme opsiyoneldir
Section titled “Düşünme opsiyoneldir”Varsayılan olarak model düşünmeden yanıtlar; düşünme tokenı harcanmaz. Adım adım akıl yürütme gereken işlerde iki yoldan biriyle açabilirsiniz:
{ "model": "llmtr/gemma-4:think", "messages": [{ "role": "user", "content": "Bu mantik bulmacasini coz." }] }{ "model": "llmtr/gemma-4", "reasoning": true, "messages": [{ "role": "user", "content": "Bu mantik bulmacasini coz." }] }Kapatmak için :fast seçicisini veya reasoning: false değerini kullanın. Düşünme açıkken üretilen akıl yürütme message.reasoning_content alanında döner ve max_tokens bütçenizden harcanarak çıktı olarak faturalanır. Çok küçük bir max_tokens değerinde bütçe düşünmede tükenebilir ve content boş dönebilir.
Görsel girdi
Section titled “Görsel girdi”Model görselleri okur, ancak görseli yalnızca base64 data URL olarak kabul eder. Uzak bir https:// adresi gönderirseniz istek 400 unsupported_input döner.
{ "model": "llmtr/gemma-4", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Bu gorselde ne var?" }, { "type": "image_url", "image_url": { "url": "data:image/png;base64,iVBORw0KGgo..." } } ] } ], "max_tokens": 1024}Görsel tokenları normal input tokenı olarak faturalanır; ayrı bir görsel tarifesi yoktur.
Araç çağırma
Section titled “Araç çağırma”Model standart OpenAI tools şemasını destekler ve gerçek tool_calls döndürür:
{ "choices": [ { "message": { "role": "assistant", "content": "", "tool_calls": [ { "id": "call_1", "type": "function", "function": { "name": "get_weather", "arguments": "{\"city\":\"Istanbul\"}" } } ] }, "finish_reason": "tool_calls" } ]}Prompt cache
Section titled “Prompt cache”Tekrar eden istem başlangıçları önbellekten karşılanır. Önbellekten gelen tokenlar prompt_tokens_details.cached_tokens alanında raporlanır ve input yerine cache read tarifesinden faturalanır:
"usage": { "prompt_tokens": 1603, "completion_tokens": 2, "prompt_tokens_details": { "cached_tokens": 1579 }}Bu örnekte 1579 token 0.50 $/1M, kalan 24 token 2.00 $/1M üzerinden ücretlendirilir.
Hız ve uzun promptlar
Section titled “Hız ve uzun promptlar”Üretim hızı saniyede yaklaşık 30-45 tokendir; 128K bağlam penceresi uzun dokümanlarla pratikte kullanılabilir. İstemci tarafında:
- Uzun çıktılarda
stream: truekullanın ve istemci okuma zaman aşımınızı en az 120 saniye tutun. Çoğu HTTP istemcisinin 60 saniyelik varsayılanı uzun yanıtlarda yetersiz kalır. - Aynı öneki (sistem talimatı, doküman, konuşma geçmişi) tekrar gönderin: önek önbelleğe alınır, yanıt belirgin şekilde hızlanır ve önbellekten okunan tokenlar daha ucuz faturalanır.
- Yoğun dönemlerde yanıt süresi uzayabilir; okuma zaman aşımını dar tutmayın.
Ayrıntı için Zaman aşımları ve yavaş modeller sayfasına bakın.