Thinking Machines Inkling
Inkling, Thinking Machines’in acik agirlikli amiral gemisi modelidir: 975 milyar toplam, token basina 41 milyar aktif parametreli bir Mixture-of-Experts mimarisi. Yanit vermeden once adim adim dusunur ve bu dusunme eforu istek basina ayarlanabilir. thinkingmachines/inkling canonical model kimligi ile /v1/chat/completions uzerinden cagrilir.
| Model | Baglam | Input / Cache Read / Output ($/1M) |
|---|---|---|
thinkingmachines/inkling | 64K | Bkz. fiyatlandirma notu |
curl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "thinkingmachines/inkling", "messages": [ { "role": "user", "content": "Kisa bir haiku yaz." } ], "max_tokens": 1024 }'Reasoning effort
Section titled “Reasoning effort”Inkling varsayilan olarak reasoning acik gelir ve her istekte yanit oncesi dusunur. Dusunme eforunu reasoning_effort alani ile ayarlarsiniz; gecerli degerler alti seviyedir: none, minimal, low, medium, high, xhigh. none reasoning’i tamamen kapatir.
Efor, model kimligine suffix olarak da verilebilir:
thinkingmachines/inkling -> varsayilan (reasoning acik)thinkingmachines/inkling:none -> reasoning kapalithinkingmachines/inkling:high -> yuksek eforthinkingmachines/inkling:xhigh -> en yuksek eforcurl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "thinkingmachines/inkling", "messages": [{ "role": "user", "content": "17 * 23 kac eder?" }], "reasoning_effort": "none", "max_tokens": 256 }'Reasoning tokenlari completion_tokens icinde doner ve cikti olarak ucretlendirilir (ayrica faturalanmaz). Bunun pratik sonucu: max_tokens cok dusuk verilirse butce reasoning asamasinda tukenebilir ve content bos, finish_reason length doner. Kisa yanitlarda bile max_tokens degerini rahat tutun. Ayrinti icin Reasoning Effort sayfasina bakin.
Boolean bir reasoning alani desteklenmez; reasoning’i kapatmak icin reasoning_effort: "none" (veya :none suffix) kullanin.
Gorsel girdi
Section titled “Gorsel girdi”Inkling goruntuyu yalnizca base64 veri URL’si (data:image/...;base64,...) olarak kabul eder. Uzak http(s) gorsel URL’leri desteklenmez ve 400 ile reddedilir. Model ses girdisini bu endpoint uzerinden kabul etmez.
curl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "thinkingmachines/inkling", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Bu gorseldeki baskin rengi soyle." }, { "type": "image_url", "image_url": { "url": "data:image/png;base64,<base64>" } } ] } ], "max_tokens": 512 }'Arac cagrisi
Section titled “Arac cagrisi”Standart OpenAI tools / tool_choice alanlari desteklenir (auto ve required). Model araci cagirdiginda finish_reason tool_calls doner ve content bos kalir. Genel akis icin Tool Calling sayfasina bakin.
JSON cikti
Section titled “JSON cikti”response_format: { "type": "json_object" } desteklenir ve gecerli bir JSON nesnesi dondurur. json_schema (katı sema zorlama) bu endpoint uzerinde uygulanmaz.
Ayni prompt onekini tekrar gonderdiginizde prompt cache okumasi devreye girer; usage.prompt_tokens_details.cached_tokens dolar ve bu tokenlar cache-read fiyatindan ucretlendirilir. Cache birkac istek sonra isinir. Cache yazma ucreti yoktur.
Fiyatlandirma notu
Section titled “Fiyatlandirma notu”Inkling lansman doneminde sinirli sureli indirimli fiyatlandirilir; indirim suresi bittikten sonra fiyat otomatik olarak liste fiyatina gecer. Guncel input, cache-read ve output fiyatlarini model detay sayfasinda gorebilirsiniz. Model fiyatlarina platform marji eklenmez; marj yalnizca kredi yuklemede gecerlidir.