İçeriğe geç

Thinking Machines Inkling

Inkling, Thinking Machines’in acik agirlikli amiral gemisi modelidir: 975 milyar toplam, token basina 41 milyar aktif parametreli bir Mixture-of-Experts mimarisi. Yanit vermeden once adim adim dusunur ve bu dusunme eforu istek basina ayarlanabilir. thinkingmachines/inkling canonical model kimligi ile /v1/chat/completions uzerinden cagrilir.

ModelBaglamInput / Cache Read / Output ($/1M)
thinkingmachines/inkling64KBkz. fiyatlandirma notu
Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "thinkingmachines/inkling",
"messages": [
{ "role": "user", "content": "Kisa bir haiku yaz." }
],
"max_tokens": 1024
}'

Inkling varsayilan olarak reasoning acik gelir ve her istekte yanit oncesi dusunur. Dusunme eforunu reasoning_effort alani ile ayarlarsiniz; gecerli degerler alti seviyedir: none, minimal, low, medium, high, xhigh. none reasoning’i tamamen kapatir.

Efor, model kimligine suffix olarak da verilebilir:

thinkingmachines/inkling -> varsayilan (reasoning acik)
thinkingmachines/inkling:none -> reasoning kapali
thinkingmachines/inkling:high -> yuksek efor
thinkingmachines/inkling:xhigh -> en yuksek efor
Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "thinkingmachines/inkling",
"messages": [{ "role": "user", "content": "17 * 23 kac eder?" }],
"reasoning_effort": "none",
"max_tokens": 256
}'

Reasoning tokenlari completion_tokens icinde doner ve cikti olarak ucretlendirilir (ayrica faturalanmaz). Bunun pratik sonucu: max_tokens cok dusuk verilirse butce reasoning asamasinda tukenebilir ve content bos, finish_reason length doner. Kisa yanitlarda bile max_tokens degerini rahat tutun. Ayrinti icin Reasoning Effort sayfasina bakin.

Boolean bir reasoning alani desteklenmez; reasoning’i kapatmak icin reasoning_effort: "none" (veya :none suffix) kullanin.

Inkling goruntuyu yalnizca base64 veri URL’si (data:image/...;base64,...) olarak kabul eder. Uzak http(s) gorsel URL’leri desteklenmez ve 400 ile reddedilir. Model ses girdisini bu endpoint uzerinden kabul etmez.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "thinkingmachines/inkling",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Bu gorseldeki baskin rengi soyle." },
{ "type": "image_url", "image_url": { "url": "data:image/png;base64,<base64>" } }
]
}
],
"max_tokens": 512
}'

Standart OpenAI tools / tool_choice alanlari desteklenir (auto ve required). Model araci cagirdiginda finish_reason tool_calls doner ve content bos kalir. Genel akis icin Tool Calling sayfasina bakin.

response_format: { "type": "json_object" } desteklenir ve gecerli bir JSON nesnesi dondurur. json_schema (katı sema zorlama) bu endpoint uzerinde uygulanmaz.

Ayni prompt onekini tekrar gonderdiginizde prompt cache okumasi devreye girer; usage.prompt_tokens_details.cached_tokens dolar ve bu tokenlar cache-read fiyatindan ucretlendirilir. Cache birkac istek sonra isinir. Cache yazma ucreti yoktur.

Inkling lansman doneminde sinirli sureli indirimli fiyatlandirilir; indirim suresi bittikten sonra fiyat otomatik olarak liste fiyatina gecer. Guncel input, cache-read ve output fiyatlarini model detay sayfasinda gorebilirsiniz. Model fiyatlarina platform marji eklenmez; marj yalnizca kredi yuklemede gecerlidir.