İçeriğe geç

LLMTR Qwen 3.5 4B

Qwen 3.5 4B, Türkiye'de barındırdığımız birinci taraf sohbet modelidir. llmtr/qwen3-5-4b canonical model kimliği ile /v1/chat/completions üzerinden çağrılır. Küçük ve hızlı bir modeldir; Türkçe sohbet, özetleme, sınıflandırma, RAG chatbot ve araç çağırma gerektiren ajan akışları için uygundur.

ÖzellikDeğer
Model kimliğillmtr/qwen3-5-4b
Bağlam penceresi131.072 token (128K)
Fiyat (input / output / cache read)1.00 / 3.00 / 0.25 $ per 1M token
Görsel girdiYok
Prompt cacheVar
Araç çağırmaVar
Düşünme moduVar, varsayılan açık
Ses / video girdisiYok
Görsel üretimiYok
Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "llmtr/qwen3-5-4b",
"messages": [
{ "role": "user", "content": "Bu urun aciklamasini iki cumlede ozetle." }
],
"max_tokens": 2048
}'

Model, yanıt üretmeden önce bir akıl yürütme adımı çalıştırır. Bu akıl yürütme size message.reasoning_content alanında döner ve ürettiği tokenlar max_tokens bütçenizden harcanır.

Bunun pratik sonucu: bütçe küçükse akıl yürütme bütçeyi tüketir, content boş gelir ve finish_reason length olur.

{
"choices": [
{
"message": { "role": "assistant", "content": "", "reasoning_content": "..." },
"finish_reason": "length"
}
],
"usage": { "completion_tokens": 400 }
}

Varsayılan modda max_tokens değerini en az 2048 verin.

Kısa yanıt bekliyorsanız düşünmeyi kapatın. İki yol da aynı işi yapar:

// Model kimliğine :fast suffix'i
{ "model": "llmtr/qwen3-5-4b:fast", "messages": [{ "role": "user", "content": "Bu yorum olumlu mu olumsuz mu? Tek kelime." }], "max_tokens": 16 }
// Veya istek gövdesinde reasoning alanı
{ "model": "llmtr/qwen3-5-4b", "reasoning": false, "messages": [{ "role": "user", "content": "Bu yorum olumlu mu olumsuz mu? Tek kelime." }], "max_tokens": 16 }

Düşünme kapalıyken yanıt reasoning_content içermez, ekstra token harcanmaz ve yanıt belirgin şekilde hızlanır. :think suffix'i düşünmeyi açık tutar; varsayılan davranış zaten budur.

Akıl yürütme tokenları output olarak faturalanır ve completion_tokens içinde zaten sayılıdır; ikinci kez ücretlendirilmez.

Model yalnızca metin kabul eder. Mesaj içinde image_url, ses veya video parçası gönderirseniz istek 400 unsupported_input döner:

{
"error": {
"message": "Model does not support image input",
"type": "unsupported_input"
}
}

Görsel okuması gereken işler için katalogdaki görsel girdi destekleyen modellerden birini seçin.

Model standart OpenAI tools şemasını destekler ve gerçek tool_calls döndürür:

{
"choices": [
{
"message": {
"role": "assistant",
"content": "",
"tool_calls": [
{
"id": "call_1",
"type": "function",
"function": { "name": "get_weather", "arguments": "{\"city\":\"Ankara\"}" }
}
]
},
"finish_reason": "tool_calls"
}
]
}

Çok adımlı akışlarda assistant mesajını tool_calls ve varsa reasoning_content alanlarıyla birlikte geçmişe ekleyin. Araç çağırma akışlarında düşünmeyi açık bırakmak model kalitesini artırır, bu yüzden max_tokens değerini bol tutun.

Tekrar eden istem başlangıçları (uzun sistem promptu, sabit RAG bağlamı, ajan döngüsü) önbellekten karşılanır. Önbellekten gelen tokenlar prompt_tokens_details.cached_tokens alanında raporlanır ve input yerine cache read tarifesinden faturalanır:

"usage": {
"prompt_tokens": 1087,
"completion_tokens": 3,
"total_tokens": 1090,
"prompt_tokens_details": { "cached_tokens": 1065 }
}

Bu örnekte 1065 token 0.25 $/1M, kalan 22 token 1.00 $/1M üzerinden ücretlendirilir. Maliyeti düşürmek için sabit içeriği mesaj dizisinin başında, değişen içeriği sonunda tutun.

Önbellek isabeti garanti değildir: bir önek ilk tekrarlarda isabet etmeyebilir, sürekli kullanıldıkça isabet oranı artar. Faturalama her zaman cached_tokens alanında bildirilen gerçek değere göre yapılır; isabet olmayan istekler normal input tarifesinden ücretlendirilir. Bu nedenle önbelleği bir maliyet optimizasyonu olarak planlayın, garantili bir indirim olarak değil.

Bağlam penceresi istek başına 131.072 tokendır ve prompt ile cevabı birlikte kapsar. Bu sınırı aşan istekler 400 döner. Uzun dokümanları tek istekte göndermek yerine bölerek gönderin veya RAG ile ilgili bölümü seçin.