İçeriğe geç

LLMTR Ornith 1.0 35B

Ornith 1.0 35B, Türkiye'de barındırdığımız birinci taraf kodlama modelidir. Tek seferlik kod üretmekten çok, gerçek depolar içinde çok adımlı görevleri sürdürmek üzere eğitilmiştir. llmtr/ornith-1-35b canonical model kimliği ile /v1/chat/completions üzerinden çağrılır.

ÖzellikDeğer
Model kimliğillmtr/ornith-1-35b
Bağlam penceresi32.768 token
Fiyat (input / output / cache read)2.00 / 5.00 / 0.50 $ per 1M token
Araç çağırmaVar
Prompt cacheVar
Görsel girdiYok (metin)
ReasoningHer zaman açık, kapatılamaz
Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "llmtr/ornith-1-35b",
"messages": [
{ "role": "user", "content": "Bu Python fonksiyonundaki hatayi bul ve duzelt." }
],
"max_tokens": 2048,
"stream": true
}'

Model yanıt vermeden önce her istekte adım adım düşünür. Bu davranış kapatılamaz: reasoning: false veya benzeri alanlar gönderseniz de model yine düşünür. Düşünme adımları yanıt içeriğine karışmaz, message.reasoning_content alanında ayrı olarak döner.

Bunun pratik sonucu şudur: düşünme, max_tokens bütçenizden harcanır. Bütçe küçükse tamamı düşünmede tükenir, content boş döner ve finish_reason length olur. Önemsiz bir soruda bile birkaç yüz token düşünmeye gidebilir.

max_tokens değerini en az 1500 verin. Kodlama ve ajan görevlerinde 2048-4000 aralığı önerilir.

Reasoning tokenları completion_tokens içinde döner ve çıktı olarak ücretlendirilir; ayrıca faturalanmaz.

Ornith, uzun ve çok adımlı kodlama görevleri için tasarlanmıştır. Bu tür isteklerde yanıt üretimi, hafif sohbet modellerine kıyasla belirgin şekilde uzun sürer; istenen çıktı büyüdükçe süre de artar.

Bu model için "stream": true kullanmanızı öneririz. Streaming isteklerinde gateway, model henüz yanıtı üretirken bağlantıyı açık tutar ve düzenli aralıklarla SSE keepalive çerçevesi gönderir; böylece aradaki vekil sunucular bağlantıyı boşta sayıp düşürmez. Keepalive çerçeveleri SSE yorum satırıdır (: ile başlar) ve uyumlu her istemci tarafından yok sayılır — içerik olarak yorumlanmazlar.

Streaming kullanmıyorsanız istemci tarafındaki zaman aşımını cömert tutun; çoğu HTTP istemcisinin varsayılanı (genellikle 30-120 saniye) bu model için yetersizdir. 30 dakikalık bir zaman aşımı güvenli bir başlangıç değeridir.

Yoğun anlarda model yeni bir isteği hemen karşılayamayabilir. İstek bekletilmez; model_busy tipiyle HTTP 503 döner ve yanıt bir Retry-After başlığı taşır:

{
"error": {
"message": "This model is at capacity right now. Please try again in a few minutes.",
"type": "model_busy"
}
}

Bu hatayı aldığınızda Retry-After süresini bekleyip tekrar deneyin. Hata geçicidir ve isteğiniz için ücret alınmaz.

Model, standart OpenAI tools / tool_choice alanlarını destekler ve araç çağırdığında finish_reason tool_calls döner. Ayrıntılar için Tool Calling sayfasına bakın.

Araç çağıran turlarda content boş, tool_calls dolu döner; bu beklenen davranıştır. Sonraki turda assistant mesajını tool_calls alanıyla birlikte geçmişe ekleyin.

Ardışık isteklerde ortak prompt ön eki (sistem istemi, aynı konuşmanın geçmişi) otomatik olarak önbellekte tutulur. Önbellekten karşılanan token sayısı usage.prompt_tokens_details.cached_tokens alanında döner ve bu tokenlar input fiyatı yerine cache read fiyatından (1M token başına 0.50 $) faturalanır.

Sistem isteminizi ve konuşma geçmişinizi istekler arasında aynı sırada tutmak önbellek isabet oranını belirgin şekilde artırır.

Model yalnızca metin kabul eder. image_url içeren bir istek gateway tarafından unsupported_input tipiyle HTTP 400 ile reddedilir. Görsel anlama için katalogdaki görsel destekli modelleri kullanın.

İstekler Türkiye'deki sunucularımızda işlenir ve üçüncü taraf bir sağlayıcıya yönlendirilmez. İstem ve yanıt içerikleri veritabanına kaydedilmez.