LLMTR / llmtr/qwen3-5-4b

Qwen 3.5 4B - LLMTR üzerinden erişim

LLMTR Qwen 3.5 4B, sunucuları Türkiye'de konumlanmış birinci taraf dil modelidir. OpenAI uyumlu Chat Completions şemasıyla çağrılır; istekleriniz üçüncü taraf bir sağlayıcıya yönlendirilmez. 128K bağlam penceresi sunar (istek başına prompt ve cevap birlikte). Küçük ve hızlı bir modeldir: Türkçe sohbet, özetleme, sınıflandırma, RAG chatbot ve araç çağırma (tool calling) gerektiren ajan akışları için uygundur. Yalnızca metin girdisi kabul eder; görsel, ses ve video gönderilirse istek 400 ile reddedilir. Aynı prompt önekini tekrar gönderdiğinizde prompt cache devreye girer ve cache'ten okunan tokenlar indirimli fiyatlanır; bu, uzun sistem promptu kullanan akışlarda maliyeti belirgin şekilde düşürür. Düşünme (thinking) modu varsayılan olarak açıktır: model yanıttan önce bir akıl yürütme üretir, bunu `reasoning_content` alanında size döndürür ve bu tokenlar `max_tokens` bütçenizden harcanır. Bu nedenle varsayılan modda `max_tokens` değerini en az 2048 verin; daha küçük bir bütçede akıl yürütme bütçeyi tüketir ve içerik boş dönebilir. Düşünmeyi kapatmak için `llmtr/qwen3-5-4b:fast` kullanın veya istek gövdesine `reasoning: false` ekleyin.

Teknik özellikler

Canonical IDllmtr/qwen3-5-4b
SağlayıcıLLMTR
Context penceresi131.072 tokens
OperasyonlarCHAT_COMPLETIONS
Modalitelertext

Fiyatlandırma

Kredi yüklemede %8 platform marjı uygulanır; model kullanım fiyatları ayrıca yükseltilmez.

OperationMetricUnitPrice
CHAT_COMPLETIONSINPUT_TEXTPER_1M_TOKENS$1.00
CHAT_COMPLETIONSCACHE_READPER_1M_TOKENS$0.250000
CHAT_COMPLETIONSOUTPUT_TEXTPER_1M_TOKENS$3.00

Örnek kullanım

Mevcut OpenAI SDK akışında yalnızca base URL ve model kimliğini değiştirirsiniz.

curl https://llmtr.com/v1/chat/completions \
  -H "Authorization: Bearer llmtr-your_key" \
  -H "Content-Type: application/json" \
  -d '{"model":"llmtr/qwen3-5-4b","messages":[{"role":"user","content":"Hello"}]}'

İlgili modeller