LLMTR Ornith 1.0 35B
Ornith 1.0 35B, Türkiye'de barındırdığımız birinci taraf kodlama modelidir. Tek seferlik kod üretmekten çok, gerçek depolar içinde çok adımlı görevleri sürdürmek üzere eğitilmiştir. llmtr/ornith-1-35b canonical model kimliği ile /v1/chat/completions üzerinden çağrılır.
| Özellik | Değer |
|---|---|
| Model kimliği | llmtr/ornith-1-35b |
| Bağlam penceresi | 32.768 token |
| Fiyat (input / output / cache read) | 2.00 / 5.00 / 0.50 $ per 1M token |
| Araç çağırma | Var |
| Prompt cache | Var |
| Görsel girdi | Yok (metin) |
| Reasoning | Her zaman açık, kapatılamaz |
curl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "llmtr/ornith-1-35b", "messages": [ { "role": "user", "content": "Bu Python fonksiyonundaki hatayi bul ve duzelt." } ], "max_tokens": 2048, "stream": true }'Reasoning her zaman açık
Section titled “Reasoning her zaman açık”Model yanıt vermeden önce her istekte adım adım düşünür. Bu davranış kapatılamaz: reasoning: false veya benzeri alanlar gönderseniz de model yine düşünür. Düşünme adımları yanıt içeriğine karışmaz, message.reasoning_content alanında ayrı olarak döner.
Bunun pratik sonucu şudur: düşünme, max_tokens bütçenizden harcanır. Bütçe küçükse tamamı düşünmede tükenir, content boş döner ve finish_reason length olur. Önemsiz bir soruda bile birkaç yüz token düşünmeye gidebilir.
max_tokens değerini en az 1500 verin. Kodlama ve ajan görevlerinde 2048-4000 aralığı önerilir.
Reasoning tokenları completion_tokens içinde döner ve çıktı olarak ücretlendirilir; ayrıca faturalanmaz.
Yanıt süresi ve streaming
Section titled “Yanıt süresi ve streaming”Ornith, uzun ve çok adımlı kodlama görevleri için tasarlanmıştır. Bu tür isteklerde yanıt üretimi, hafif sohbet modellerine kıyasla belirgin şekilde uzun sürer; istenen çıktı büyüdükçe süre de artar.
Bu model için "stream": true kullanmanızı öneririz. Streaming isteklerinde gateway, model henüz yanıtı üretirken bağlantıyı açık tutar ve düzenli aralıklarla SSE keepalive çerçevesi gönderir; böylece aradaki vekil sunucular bağlantıyı boşta sayıp düşürmez. Keepalive çerçeveleri SSE yorum satırıdır (: ile başlar) ve uyumlu her istemci tarafından yok sayılır — içerik olarak yorumlanmazlar.
Streaming kullanmıyorsanız istemci tarafındaki zaman aşımını cömert tutun; çoğu HTTP istemcisinin varsayılanı (genellikle 30-120 saniye) bu model için yetersizdir. 30 dakikalık bir zaman aşımı güvenli bir başlangıç değeridir.
Yoğunluk yanıtı
Section titled “Yoğunluk yanıtı”Yoğun anlarda model yeni bir isteği hemen karşılayamayabilir. İstek bekletilmez; model_busy tipiyle HTTP 503 döner ve yanıt bir Retry-After başlığı taşır:
{ "error": { "message": "This model is at capacity right now. Please try again in a few minutes.", "type": "model_busy" }}Bu hatayı aldığınızda Retry-After süresini bekleyip tekrar deneyin. Hata geçicidir ve isteğiniz için ücret alınmaz.
Araç çağırma
Section titled “Araç çağırma”Model, standart OpenAI tools / tool_choice alanlarını destekler ve araç çağırdığında finish_reason tool_calls döner. Ayrıntılar için Tool Calling sayfasına bakın.
Araç çağıran turlarda content boş, tool_calls dolu döner; bu beklenen davranıştır. Sonraki turda assistant mesajını tool_calls alanıyla birlikte geçmişe ekleyin.
Prompt cache
Section titled “Prompt cache”Ardışık isteklerde ortak prompt ön eki (sistem istemi, aynı konuşmanın geçmişi) otomatik olarak önbellekte tutulur. Önbellekten karşılanan token sayısı usage.prompt_tokens_details.cached_tokens alanında döner ve bu tokenlar input fiyatı yerine cache read fiyatından (1M token başına 0.50 $) faturalanır.
Sistem isteminizi ve konuşma geçmişinizi istekler arasında aynı sırada tutmak önbellek isabet oranını belirgin şekilde artırır.
Görsel girdi
Section titled “Görsel girdi”Model yalnızca metin kabul eder. image_url içeren bir istek gateway tarafından unsupported_input tipiyle HTTP 400 ile reddedilir. Görsel anlama için katalogdaki görsel destekli modelleri kullanın.
Veri yerleşimi
Section titled “Veri yerleşimi”İstekler Türkiye'deki sunucularımızda işlenir ve üçüncü taraf bir sağlayıcıya yönlendirilmez. İstem ve yanıt içerikleri veritabanına kaydedilmez.