Thinking Machines Inkling
Inkling, Thinking Machines'in acik agirlikli amiral gemisi modelidir: 975 milyar toplam, token basina 41 milyar aktif parametreli bir Mixture-of-Experts mimarisi. Inkling Small ayni mimariyi ve ayni yetenekleri 276 milyar toplam / 12 milyar aktif parametreyle, yaklasik ucte bir fiyata sunar. Ikisi de yanit vermeden once adim adim dusunur ve bu dusunme eforu istek basina ayarlanir. /v1/chat/completions uzerinden cagrilirlar.
| Model | Baglam | Input / Cache Read / Output ($/1M) |
|---|---|---|
thinkingmachines/inkling | 256K | Bkz. fiyatlandirma notu |
thinkingmachines/inkling-small | 256K | Bkz. fiyatlandirma notu |
Iki modelin yetenek kumesi aynidir; bu sayfadaki her ornek ikisinde de calisir. Yuksek hacimli islerde Inkling Small, en yuksek kalite gereken islerde Inkling tercih edilir.
curl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "thinkingmachines/inkling", "messages": [ { "role": "user", "content": "Kisa bir haiku yaz." } ], "max_tokens": 1024 }'Reasoning effort
Section titled “Reasoning effort”Inkling varsayilan olarak reasoning acik gelir ve her istekte yanit oncesi dusunur. Dusunme eforunu reasoning_effort alani ile ayarlarsiniz; gecerli degerler alti seviyedir: none, minimal, low, medium, high, xhigh. none reasoning'i tamamen kapatir.
Efor, model kimligine suffix olarak da verilebilir:
thinkingmachines/inkling -> varsayilan (reasoning acik)thinkingmachines/inkling:none -> reasoning kapalithinkingmachines/inkling:high -> yuksek eforthinkingmachines/inkling:xhigh -> en yuksek eforcurl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "thinkingmachines/inkling", "messages": [{ "role": "user", "content": "17 * 23 kac eder?" }], "reasoning_effort": "none", "max_tokens": 256 }'Reasoning tokenlari completion_tokens icinde doner ve cikti olarak ucretlendirilir (ayrica faturalanmaz). Bunun pratik sonucu: max_tokens cok dusuk verilirse butce reasoning asamasinda tukenebilir ve content bos, finish_reason length doner. Kisa yanitlarda bile max_tokens degerini rahat tutun. Ayrinti icin Reasoning Effort sayfasina bakin.
Boolean bir reasoning alani desteklenmez; reasoning'i kapatmak icin reasoning_effort: "none" (veya :none suffix) kullanin.
Gorsel girdi
Section titled “Gorsel girdi”Her iki model de goruntuyu yalnizca base64 veri URL'si (data:image/...;base64,...) olarak kabul eder. Uzak http(s) gorsel URL'leri desteklenmez ve 400 ile reddedilir.
curl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "thinkingmachines/inkling", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Bu gorseldeki baskin rengi soyle." }, { "type": "image_url", "image_url": { "url": "data:image/png;base64,<base64>" } } ] } ], "max_tokens": 512 }'Ses girdisi
Section titled “Ses girdisi”Her iki model ses girdisini de kabul eder. Sesi input_audio icerik parcasi olarak, base64 kodlu WAV ile gonderin (16 kHz mono onerilir):
curl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "thinkingmachines/inkling-small", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Bu kayitta ne duyuyorsun?" }, { "type": "input_audio", "input_audio": { "data": "<base64-wav>", "format": "wav" } } ] } ], "max_tokens": 512 }'Bos (frame icermeyen) bir WAV gonderilirse istek 400 ile reddedilir. Ses tokenlari girdi olarak ucretlendirilir.
Arac cagrisi
Section titled “Arac cagrisi”Standart OpenAI tools / tool_choice alanlari desteklenir (auto ve required). Model araci cagirdiginda finish_reason tool_calls doner ve content bos kalir. Genel akis icin Tool Calling sayfasina bakin.
JSON cikti
Section titled “JSON cikti”response_format: { "type": "json_object" } desteklenir ve gecerli bir JSON nesnesi dondurur. json_schema (katı sema zorlama) bu endpoint uzerinde uygulanmaz.
Ayni prompt onekini tekrar gonderdiginizde prompt cache okumasi devreye girer; usage.prompt_tokens_details.cached_tokens dolar ve bu tokenlar cache-read fiyatindan ucretlendirilir. Cache birkac istek sonra isinir. Cache yazma ucreti yoktur.
Baglam penceresi
Section titled “Baglam penceresi”Iki model de tek istekte 262.144 tokene kadar prompt kabul eder. Bu siniri asan istekler gateway tarafindan reddedilir.
Fiyatlandirma notu
Section titled “Fiyatlandirma notu”Her iki model de saglayicinin sinirli sureli lansman indirimi suresince indirimli fiyattan ucretlendirilir; indirim bittiginde fiyat liste fiyatina doner. Inkling Small, Inkling'in yaklasik ucte biri fiyatindadir. Guncel input, cache-read ve output fiyatlarini model detay sayfasinda gorebilirsiniz. Model fiyatlarina platform marji eklenmez; marj yalnizca kredi yuklemede gecerlidir.