İçeriğe geç

KwaiKAT KAT-Coder Modelleri

KwaiKAT (Kwaipilot / Kuaishou StreamLake) KAT-Coder modelleri, gerçek depolar içinde çok adımlı yazılım işleri için tasarlanmış agentic kod modelleridir. kwaikat/... canonical model kimliği ile /v1/chat/completions üzerinden çağrılır.

ModelBağlamInput / Output / Cache Read ($/1M)Not
kwaikat/kat-coder-pro-v2.5256K0.74 / 2.96 / 0.15Amiral gemisi; depo ölçekli agentic işler.
kwaikat/kat-coder-air-v2.5256K0.15 / 0.60 / 0.03Ekonomik; yüksek hacimli akışlar.

Her iki model de araç/fonksiyon çağrısı, base64 görsel girdi ve prompt cache okuması destekler.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "kwaikat/kat-coder-pro-v2.5",
"messages": [
{ "role": "user", "content": "Bu depodaki testleri çalıştırıp kırılan testi düzelt." }
],
"max_tokens": 2048
}'

KAT-Coder modelleri yanıt vermeden önce her istekte adım adım düşünür; reasoning kapatılamaz ve reasoning_effort gibi alanlar yok sayılır. Reasoning tokenları completion_tokens içinde döner ve çıktı olarak ücretlendirilir (ayrıca faturalanmaz).

Bunun pratik sonucu: max_tokens düşük verilirse bütçe reasoning aşamasında tükenebilir ve content boş, finish_reason length döner. Kısa yanıtlarda bile max_tokens değerini rahat tutun (öneri: en az 1024). Ayrıntı için Reasoning Effort sayfasına bakın.

Modeller görseli yalnızca base64 veri URL’si (data:image/...;base64,...) olarak kabul eder. Uzak http(s) görsel URL’leri desteklenmez ve gateway bunları 400 unsupported_input ile reddeder.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "kwaikat/kat-coder-air-v2.5",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Bu ekran görüntüsündeki hata mesajını özetle." },
{ "type": "image_url", "image_url": { "url": "data:image/png;base64,<base64>" } }
]
}
],
"max_tokens": 1024
}'

Standart OpenAI tools / tool_choice alanları desteklenir. Model araç çağırdığında finish_reason tool_calls döner ve content boş kalır. Genel akış için Tool Calling sayfasına bakın.

Aynı prompt önekini tekrar gönderdiğinizde prompt cache okuması devreye girer; usage.prompt_tokens_details.cached_tokens dolar ve bu tokenlar cache-read fiyatından ücretlendirilir. Cache birkaç istek sonra ısınır. Cache yazma ücreti yoktur.