Z.AI Thinking Kontrolu
Z.AI GLM modelleri, yanıt üretmeden önce iç bir düşünce zinciri (reasoning_content) oluşturabilir.
Bu, yanıt kalitesini artırır; ancak düşünce tokenleri de çıktı tokeni olarak faturalanır, max_tokens
bütçesinden tüketilir ve yanıt süresini uzatır.
GLM-5.3 ve GLM-5.3-Flash dışındaki thinking destekli GLM modellerinde thinking varsayılan olarak KAPALIDIR (opt-in). Bu modellerde sade bir istek düşünce tokeni harcamaz; thinking'i yalnızca açıkça istediğinizde çalışır:
- Model slug suffix —
zai/glm-5.1:think(açar) /zai/glm-5.1:fast(kapatır) - Body alanı —
{ "reasoning": true }(açar) /{ "reasoning": false }(kapatır)
Bu iki istisna dışındaki modellerde suffix veya body verilmezse gateway, Z.AI API'sine
thinking: { "type": "disabled" } iletir.
Hangi modeller thinking destekler?
Section titled “Hangi modeller thinking destekler?”| Model | LLMTR varsayılanı | Açıkça etkinleştirilebilir mi? |
|---|---|---|
| GLM-5.3-Flash | Her zaman açık, low seviyesinde | Kapatılamaz; seviye seçilir |
| GLM-5.3 | Her zaman açık, low seviyesinde | Kapatılamaz; seviye seçilir |
| GLM-5.2 | Kapalı (opt-in) | Evet, reasoning_effort ile |
| GLM-5.1, GLM-5, GLM-5-Turbo | Kapalı (opt-in) | Evet |
| GLM-5V-Turbo | Kapalı (opt-in) | Evet |
| GLM-4.7, GLM-4.7-FlashX | Kapalı (opt-in) | Evet |
| GLM-4.6, GLM-4.6V, GLM-4.6V-FlashX | Kapalı (opt-in) | Evet |
| GLM-4.5, GLM-4.5-X, GLM-4.5-Air, GLM-4.5-AirX, GLM-4.5V | Kapalı (opt-in) | Evet |
| GLM-OCR, GLM-4-32B-0414-128K | — | Hayır |
GLM-5.3 ve GLM-5.3-Flash dışındaki thinking destekli tüm GLM modellerinde davranış aynıdır: :think suffix veya
reasoning: true gönderildiğinde model düşünce zinciri üretir, aksi halde doğrudan yanıt verir.
GLM-5.3 ailesi: akil yurutme her zaman acik
Section titled “GLM-5.3 ailesi: akil yurutme her zaman acik”GLM-5.3 ve GLM-5.3-Flash'ta akıl yürütme kapatılamaz. Kapatma girişimi yapan her istek üstte 400 ile reddedilir; LLMTR bu isteği sağlayıcıya göndermeden önce durdurur ve hangi seviyeleri seçebileceğinizi söyler.
| İstek | Sonuç |
|---|---|
zai/glm-5.3 (düz istek) | Çalışır. LLMTR low seviyesini gönderir. |
zai/glm-5.3:low, :high, :max | Çalışır. Seçilen seviye gönderilir. |
zai/glm-5.3:think | Çalışır. Akıl yürütme zaten açık olduğundan seviye low kalır. |
zai/glm-5.3:fast | 400 — akıl yürütme kapatılamaz. |
"reasoning": false | 400 — akıl yürütme kapatılamaz. |
"thinking": { "type": "disabled" } | 400 — akıl yürütme kapatılamaz. |
:none, :minimal, :medium, :xhigh | 400 — bu model yalnızca low, high, max kabul eder. |
Tablodaki kurallar zai/glm-5.3-flash kimliği için de aynıdır. Flash modeli ayrıca görsel girdi
kabul eder; örnekler ve zaman pencereli fiyatlar için GLM-5.3-Flash
sayfasına bakın.
Varsayılan neden low? Modelin kendi varsayılanı max, yani en derin ve en pahalı seviyedir.
Kısa bir istekte bile onlarca düşünce tokeni üretir ve bunlar çıktı tokeni olarak faturalanır.
LLMTR düz istekleri low ile gönderir; böylece basit çağrılar ucuz kalır, derinliğe ihtiyaç
duyduğunuzda seviyeyi kendiniz yükseltirsiniz.
curl https://llmtr.com/v1/chat/completions -H "Authorization: Bearer llmtr-your_key" -H "Content-Type: application/json" -d '{ "model": "zai/glm-5.3:max", "messages": [ {"role": "user", "content": "Bu servisteki yarış koşulunu bul ve düzelt"} ], "max_tokens": 8000 }'Seviyeyi body üzerinden de verebilirsiniz; suffix ile body birlikte gelirse body önceliklidir.
from openai import OpenAI
client = OpenAI(base_url="https://llmtr.com/v1", api_key="llmtr-your_key")
response = client.chat.completions.create( model="zai/glm-5.3", messages=[{"role": "user", "content": "Bu fonksiyonu optimize et"}], reasoning_effort="high", max_tokens=8000,)print(response.choices[0].message.content)GLM-5.2'den geçiyorsanız: :fast ve reasoning: false kullanan çağrılarınızı zai/glm-5.3
düz haline çevirin. LLMTR'nin low varsayılanı, Z.AI'nin bu geçiş için önerdiği seviyedir.
GLM-5.3 yalnızca metin girdisi kabul eder; görsel gönderen çağrılar 400 döner.
Slug suffix ile thinking kapatma
Section titled “Slug suffix ile thinking kapatma”Suffix :fast thinking'i devre dışı bırakır. Hız öncelikli ya da max_tokens kısıtlı senaryolar için kullanın.
curl https://llmtr.com/v1/chat/completions \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "zai/glm-5.1:fast", "messages": [ {"role": "user", "content": "Merhaba"} ] }'Suffix :think thinking'i açıkça etkinleştirir (varsayılan kapalı olduğundan derin analiz için gereklidir):
"model": "zai/glm-4.5-air:think"Body alanı ile kontrol
Section titled “Body alanı ile kontrol”reasoning: false → thinking kapalı, reasoning: true → thinking açık.
Hem suffix hem body verilirse body önceliklidir.
curl https://llmtr.com/v1/chat/completions \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "zai/glm-5.1", "reasoning": false, "messages": [ {"role": "user", "content": "Hızlı cevap ver"} ] }'Python (OpenAI SDK)
Section titled “Python (OpenAI SDK)”from openai import OpenAI
client = OpenAI( base_url="https://llmtr.com/v1", api_key="llmtr-your_key",)
# Thinking kapalı — hızlı modresponse = client.chat.completions.create( model="zai/glm-5.1:fast", messages=[{"role": "user", "content": "Kısa bir selamlama yaz"}],)print(response.choices[0].message.content)
# Thinking açık — derin analizresponse = client.chat.completions.create( model="zai/glm-5.1:think", messages=[{"role": "user", "content": "Bu algoritmanın zaman karmaşıklığını açıkla"}], max_tokens=4000,)print(response.choices[0].message.content)JavaScript (OpenAI SDK)
Section titled “JavaScript (OpenAI SDK)”import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://llmtr.com/v1", apiKey: process.env.LLMTR_API_KEY,});
// Thinking devre dışıconst fast = await client.chat.completions.create({ model: "zai/glm-4.7:fast", messages: [{ role: "user", content: "Merhaba" }],});
// Thinking etkin (body üzerinden)const deep = await client.chat.completions.create({ model: "zai/glm-4.5-air", messages: [{ role: "user", content: "Bu kodu incele ve hataları listele" }], extra_body: { reasoning: true }, max_tokens: 4000,});max_tokens ve thinking
Section titled “max_tokens ve thinking”Thinking tokenleri max_tokens bütçesinden tüketilir. Thinking açıkken düşük bir max_tokens değeri
verilirse model yanıt üretemeden token limitine ulaşabilir.
Önerilen minimum max_tokens değerleri:
| Durum | Önerilen minimum |
|---|---|
| Thinking açık, kısa soru | 1 500 |
| Thinking açık, karmaşık soru | 4 000+ |
Thinking kapalı (:fast) | 256 |
Thinking kapalıyken düşünce tokeni harcanmaz; standart token sayısı yeterlidir.
Faturalama
Section titled “Faturalama”Thinking tokenleri de çıktı tokeni olarak faturalandırılır.
Thinking'i isteğe bağlı modellerde maliyeti düşürmek için :fast suffix ile kapatabilirsiniz.
GLM-5.3 ve GLM-5.3-Flash'ta kapatmak yerine low seviyesini kullanın.
Daha fazla bilgi için Faturalama sayfasına bakın.