LLMTR Qwen 3.5 4B
Qwen 3.5 4B, Türkiye'de barındırdığımız birinci taraf sohbet modelidir. llmtr/qwen3-5-4b canonical model kimliği ile /v1/chat/completions üzerinden çağrılır. Küçük ve hızlı bir modeldir; Türkçe sohbet, özetleme, sınıflandırma, RAG chatbot ve araç çağırma gerektiren ajan akışları için uygundur.
| Özellik | Değer |
|---|---|
| Model kimliği | llmtr/qwen3-5-4b |
| Bağlam penceresi | 131.072 token (128K) |
| Fiyat (input / output / cache read) | 1.00 / 3.00 / 0.25 $ per 1M token |
| Görsel girdi | Yok |
| Prompt cache | Var |
| Araç çağırma | Var |
| Düşünme modu | Var, varsayılan açık |
| Ses / video girdisi | Yok |
| Görsel üretimi | Yok |
curl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "llmtr/qwen3-5-4b", "messages": [ { "role": "user", "content": "Bu urun aciklamasini iki cumlede ozetle." } ], "max_tokens": 2048 }'Düşünme modu varsayılan açıktır
Section titled “Düşünme modu varsayılan açıktır”Model, yanıt üretmeden önce bir akıl yürütme adımı çalıştırır. Bu akıl yürütme size message.reasoning_content alanında döner ve ürettiği tokenlar max_tokens bütçenizden harcanır.
Bunun pratik sonucu: bütçe küçükse akıl yürütme bütçeyi tüketir, content boş gelir ve finish_reason length olur.
{ "choices": [ { "message": { "role": "assistant", "content": "", "reasoning_content": "..." }, "finish_reason": "length" } ], "usage": { "completion_tokens": 400 }}Varsayılan modda max_tokens değerini en az 2048 verin.
Kısa yanıt bekliyorsanız düşünmeyi kapatın. İki yol da aynı işi yapar:
// Model kimliğine :fast suffix'i{ "model": "llmtr/qwen3-5-4b:fast", "messages": [{ "role": "user", "content": "Bu yorum olumlu mu olumsuz mu? Tek kelime." }], "max_tokens": 16 }
// Veya istek gövdesinde reasoning alanı{ "model": "llmtr/qwen3-5-4b", "reasoning": false, "messages": [{ "role": "user", "content": "Bu yorum olumlu mu olumsuz mu? Tek kelime." }], "max_tokens": 16 }Düşünme kapalıyken yanıt reasoning_content içermez, ekstra token harcanmaz ve yanıt belirgin şekilde hızlanır. :think suffix'i düşünmeyi açık tutar; varsayılan davranış zaten budur.
Akıl yürütme tokenları output olarak faturalanır ve completion_tokens içinde zaten sayılıdır; ikinci kez ücretlendirilmez.
Girdi türü
Section titled “Girdi türü”Model yalnızca metin kabul eder. Mesaj içinde image_url, ses veya video parçası gönderirseniz istek 400 unsupported_input döner:
{ "error": { "message": "Model does not support image input", "type": "unsupported_input" }}Görsel okuması gereken işler için katalogdaki görsel girdi destekleyen modellerden birini seçin.
Araç çağırma
Section titled “Araç çağırma”Model standart OpenAI tools şemasını destekler ve gerçek tool_calls döndürür:
{ "choices": [ { "message": { "role": "assistant", "content": "", "tool_calls": [ { "id": "call_1", "type": "function", "function": { "name": "get_weather", "arguments": "{\"city\":\"Ankara\"}" } } ] }, "finish_reason": "tool_calls" } ]}Çok adımlı akışlarda assistant mesajını tool_calls ve varsa reasoning_content alanlarıyla birlikte geçmişe ekleyin. Araç çağırma akışlarında düşünmeyi açık bırakmak model kalitesini artırır, bu yüzden max_tokens değerini bol tutun.
Prompt cache
Section titled “Prompt cache”Tekrar eden istem başlangıçları (uzun sistem promptu, sabit RAG bağlamı, ajan döngüsü) önbellekten karşılanır. Önbellekten gelen tokenlar prompt_tokens_details.cached_tokens alanında raporlanır ve input yerine cache read tarifesinden faturalanır:
"usage": { "prompt_tokens": 1087, "completion_tokens": 3, "total_tokens": 1090, "prompt_tokens_details": { "cached_tokens": 1065 }}Bu örnekte 1065 token 0.25 $/1M, kalan 22 token 1.00 $/1M üzerinden ücretlendirilir. Maliyeti düşürmek için sabit içeriği mesaj dizisinin başında, değişen içeriği sonunda tutun.
Önbellek isabeti garanti değildir: bir önek ilk tekrarlarda isabet etmeyebilir, sürekli kullanıldıkça isabet oranı artar. Faturalama her zaman cached_tokens alanında bildirilen gerçek değere göre yapılır; isabet olmayan istekler normal input tarifesinden ücretlendirilir. Bu nedenle önbelleği bir maliyet optimizasyonu olarak planlayın, garantili bir indirim olarak değil.
Bağlam penceresi
Section titled “Bağlam penceresi”Bağlam penceresi istek başına 131.072 tokendır ve prompt ile cevabı birlikte kapsar. Bu sınırı aşan istekler 400 döner. Uzun dokümanları tek istekte göndermek yerine bölerek gönderin veya RAG ile ilgili bölümü seçin.