İçeriğe geç

Thinking Machines Inkling

Inkling, Thinking Machines'in acik agirlikli amiral gemisi modelidir: 975 milyar toplam, token basina 41 milyar aktif parametreli bir Mixture-of-Experts mimarisi. Inkling Small ayni mimariyi ve ayni yetenekleri 276 milyar toplam / 12 milyar aktif parametreyle, yaklasik ucte bir fiyata sunar. Ikisi de yanit vermeden once adim adim dusunur ve bu dusunme eforu istek basina ayarlanir. /v1/chat/completions uzerinden cagrilirlar.

ModelBaglamInput / Cache Read / Output ($/1M)
thinkingmachines/inkling256KBkz. fiyatlandirma notu
thinkingmachines/inkling-small256KBkz. fiyatlandirma notu

Iki modelin yetenek kumesi aynidir; bu sayfadaki her ornek ikisinde de calisir. Yuksek hacimli islerde Inkling Small, en yuksek kalite gereken islerde Inkling tercih edilir.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "thinkingmachines/inkling",
"messages": [
{ "role": "user", "content": "Kisa bir haiku yaz." }
],
"max_tokens": 1024
}'

Inkling varsayilan olarak reasoning acik gelir ve her istekte yanit oncesi dusunur. Dusunme eforunu reasoning_effort alani ile ayarlarsiniz; gecerli degerler alti seviyedir: none, minimal, low, medium, high, xhigh. none reasoning'i tamamen kapatir.

Efor, model kimligine suffix olarak da verilebilir:

thinkingmachines/inkling -> varsayilan (reasoning acik)
thinkingmachines/inkling:none -> reasoning kapali
thinkingmachines/inkling:high -> yuksek efor
thinkingmachines/inkling:xhigh -> en yuksek efor
Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "thinkingmachines/inkling",
"messages": [{ "role": "user", "content": "17 * 23 kac eder?" }],
"reasoning_effort": "none",
"max_tokens": 256
}'

Reasoning tokenlari completion_tokens icinde doner ve cikti olarak ucretlendirilir (ayrica faturalanmaz). Bunun pratik sonucu: max_tokens cok dusuk verilirse butce reasoning asamasinda tukenebilir ve content bos, finish_reason length doner. Kisa yanitlarda bile max_tokens degerini rahat tutun. Ayrinti icin Reasoning Effort sayfasina bakin.

Boolean bir reasoning alani desteklenmez; reasoning'i kapatmak icin reasoning_effort: "none" (veya :none suffix) kullanin.

Her iki model de goruntuyu yalnizca base64 veri URL'si (data:image/...;base64,...) olarak kabul eder. Uzak http(s) gorsel URL'leri desteklenmez ve 400 ile reddedilir.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "thinkingmachines/inkling",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Bu gorseldeki baskin rengi soyle." },
{ "type": "image_url", "image_url": { "url": "data:image/png;base64,<base64>" } }
]
}
],
"max_tokens": 512
}'

Her iki model ses girdisini de kabul eder. Sesi input_audio icerik parcasi olarak, base64 kodlu WAV ile gonderin (16 kHz mono onerilir):

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "thinkingmachines/inkling-small",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Bu kayitta ne duyuyorsun?" },
{ "type": "input_audio", "input_audio": { "data": "<base64-wav>", "format": "wav" } }
]
}
],
"max_tokens": 512
}'

Bos (frame icermeyen) bir WAV gonderilirse istek 400 ile reddedilir. Ses tokenlari girdi olarak ucretlendirilir.

Standart OpenAI tools / tool_choice alanlari desteklenir (auto ve required). Model araci cagirdiginda finish_reason tool_calls doner ve content bos kalir. Genel akis icin Tool Calling sayfasina bakin.

response_format: { "type": "json_object" } desteklenir ve gecerli bir JSON nesnesi dondurur. json_schema (katı sema zorlama) bu endpoint uzerinde uygulanmaz.

Ayni prompt onekini tekrar gonderdiginizde prompt cache okumasi devreye girer; usage.prompt_tokens_details.cached_tokens dolar ve bu tokenlar cache-read fiyatindan ucretlendirilir. Cache birkac istek sonra isinir. Cache yazma ucreti yoktur.

Iki model de tek istekte 262.144 tokene kadar prompt kabul eder. Bu siniri asan istekler gateway tarafindan reddedilir.

Her iki model de saglayicinin sinirli sureli lansman indirimi suresince indirimli fiyattan ucretlendirilir; indirim bittiginde fiyat liste fiyatina doner. Inkling Small, Inkling'in yaklasik ucte biri fiyatindadir. Guncel input, cache-read ve output fiyatlarini model detay sayfasinda gorebilirsiniz. Model fiyatlarina platform marji eklenmez; marj yalnizca kredi yuklemede gecerlidir.