InclusionAI Ling 3.0
Ling 3.0, InclusionAI'nin Mixture-of-Experts model ailesidir. LLMTR üzerinde /v1/chat/completions ile çağrılır.
| Model | Bağlam | Maksimum çıktı | Giriş / Cache okuma / Çıkış ($/1M) |
|---|---|---|---|
inclusionai/ling-3.0-flash | 262.144 | 32.768 | 0.06 / 0.012 / 0.18 |
inclusionai/ling-3.0-tiny | — | — | 15 Ağustos 2026'da emekli edildi |
Flash, 124 milyar parametreli modeldir; token başına yaklaşık 5,1 milyarı çalışır. Ajan iş akışlarında token verimliliği hedefiyle eğitilmiştir.
Varsayılan olarak düşünür ve düşünce zincirini yanıtta reasoning_content alanında ayrı döndürür; content nihai cevabı taşır.
curl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "inclusionai/ling-3.0-flash", "messages": [ { "role": "user", "content": "Bu fonksiyondaki hatayı bul." } ], "max_tokens": 8192 }'Ling 3.0 Flash: düşünmeyi kapatma
Section titled “Ling 3.0 Flash: düşünmeyi kapatma”Flash'ta düşünme reasoning_effort alanıyla denetlenir ve desteklenen tek değer none'dır. Model kimliğine :none soneki de eklenebilir:
inclusionai/ling-3.0-flash -> düşünme açık (varsayılan)inclusionai/ling-3.0-flash:none -> düşünme kapalıcurl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "inclusionai/ling-3.0-flash", "messages": [{ "role": "user", "content": "17 * 23 kaç eder?" }], "reasoning_effort": "none", "max_tokens": 512 }'Neden yalnızca none sunuluyor
Section titled “Neden yalnızca none sunuluyor”Sağlayıcı minimal, low, medium, high, xhigh ve max değerlerini de kabul eder, ancak ölçümde bu değerler düşünme uzunluğunu düzenli biçimde değiştirmemiştir: sabit bir istem üzerinde seviye başına üç örnekte max 809-1366 karakter düşünürken medium 2323-4524 karakter düşünmüştür. Aralıklar birbirinin içine geçtiği için bunlar bir kademe oluşturmaz. Etkisi olmayan bir seviyeyi sunmak, sizi değiştirmediği bir ayar için düşünme tokenı ödemeye bırakırdı.
Bu nedenle none dışında bir seviye gönderen istekler 400 ile reddedilir ve hata mesajı desteklenen değerleri listeler. Kademeli denetim sunan modeller için Reasoning Effort sayfasına bakın.
:fast ve :think sonekleri Flash'ta geçerli değildir ve 400 döner. Bu sonekler emekli edilen Tiny satırına özgüydü.
Düşünme açıkken max_tokens bütçesi
Section titled “Düşünme açıkken max_tokens bütçesi”Düşünme tokenları da çıktıdır ve completion_tokens içinde döner. Flash bazı istemlerde uzun uzun düşünebilir; ölçümde bazı istemlerde düşünce reasoning_content yerine doğrudan content içine yazılmış ve yanıt finish_reason: "length" ile bütçeyi tüketmiştir. Aynı istem reasoning_effort: "none" ile birkaç tokende doğru cevabı vermiştir.
Kısa ve kesin cevap gerektiğinde none hem hızlı hem ucuzdur. Düşünmeye ihtiyacınız varsa max_tokens değerini bol — ancak 32.768'i aşmayacak şekilde — tutun.
Ling 3.0 Tiny emekli edildi
Section titled “Ling 3.0 Tiny emekli edildi”inclusionai/ling-3.0-tiny 15 Ağustos 2026 tarihinde emekli edilmiştir. Sağlayıcı modeli kendi kataloğundan çekti; bu LLMTR'nin kararı değildir ve geri alınabilir bir durum değildir.
Bu kimliğe gönderilen istekler 410 model_retired döner. Hata gövdesi emeklilik tarihini ve yerine kullanabileceğiniz modeli içerir:
{ "error": { "message": "Model \"inclusionai/ling-3.0-tiny\" was retired on 2026-08-15. Use \"inclusionai/ling-3.0-flash\" instead.", "type": "model_retired", "details": { "model": "inclusionai/ling-3.0-tiny", "replacement_model": "inclusionai/ling-3.0-flash", "retirement_date": "2026-08-15" } }}İstekleriniz sessizce başka bir modele yönlendirilmez. Tiny ücretsizdi, yerine önerilen Flash ise ücretlidir; ücretsiz olduğu için seçtiğiniz bir çağrının haberiniz olmadan faturalanmaya başlaması kabul edilebilir bir davranış değil. Bu yüzden model kimliğini kendiniz değiştirirsiniz.
Ücretsiz bir model arıyorsanız katalogda ücretsiz satırlar bulunmaya devam ediyor; model listesinde "Free" etiketiyle görünürler.
Tiny'ye özgü olan :fast / :think sonekleri ve reasoning boolean alanı da bu satırla birlikte kalkmıştır. Flash'ta düşünme denetimi yukarıdaki reasoning_effort: "none" ile yapılır.
Araç çağrısı
Section titled “Araç çağrısı”Flash araç/fonksiyon çağrısını yerel olarak destekler. tools dizisini standart OpenAI biçiminde verirsiniz; tool_choice alanının auto, required ve adlandırılmış fonksiyon biçimlerinin üçü de çalışır.
curl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "inclusionai/ling-3.0-flash", "messages": [{ "role": "user", "content": "İstanbul hava durumu ne?" }], "tools": [{ "type": "function", "function": { "name": "get_weather", "description": "Verilen şehrin güncel hava durumunu döndürür.", "parameters": { "type": "object", "properties": { "city": { "type": "string" } }, "required": ["city"] } } }], "max_tokens": 4096 }'Genel akış için Araç Çağrısı sayfasına bakın.
Prompt cache
Section titled “Prompt cache”Aynı önek yeniden gönderildiğinde sağlayıcı prompt cache uygulayabilir ve cache'ten okunan token sayısı usage.prompt_tokens_details.cached_tokens alanında döner.
Bu doğrudan bir maliyet avantajıdır: cache'ten okunan tokenlar 1M başına 0,012 $ ile faturalanır, normal giriş fiyatının beşte biri. Uzun ve sabit bir sistem istemiyle çalışan ajanlarda fark belirgindir.
Cache isabeti garanti değildir; aynı önek art arda gönderildiğinde ilk çağrı ısınma sayılır ve isabet sonraki çağrılarda başlar.
Desteklenmeyen girdi ve çıktılar
Section titled “Desteklenmeyen girdi ve çıktılar”Flash yalnızca metin kabul eder. Aşağıdakiler 400 ile reddedilir:
- Görsel girdi (
image_urliçerik parçası) - Ses girdisi (
input_audioiçerik parçası) response_formatilejson_objectveyajson_schema
Şema zorunlu JSON çıktısı gerekiyorsa bunu destekleyen bir model seçin; bu modelden JSON'u istem içinde isteyebilirsiniz ancak biçim garanti edilmez.
Bağlam ve çıktı sınırları
Section titled “Bağlam ve çıktı sınırları”Bağlam penceresi 262.144 token, tek yanıtta üretilebilecek en fazla çıktı 32.768 tokendır. Girdi ve çıktı aynı bağlam bütçesini paylaşır, bu yüzden max_tokens değerini pencerenin tamamına ayarlamayın.
max_tokens (veya max_completion_tokens) 32.768'in üzerindeyse istek sağlayıcıya gönderilmeden LLMTR tarafından 400 invalid_request ile reddedilir. Hata gövdesi sınırı ve gönderdiğiniz değeri içerir:
{ "error": { "message": "\"inclusionai/ling-3.0-flash\" can return at most 32,768 tokens in one response, but \"max_tokens\" was 100,000. Lower it to 32,768 or below.", "type": "invalid_request", "details": { "reason": "max_output_tokens_exceeded", "field": "max_tokens", "requested": 100000, "maxOutputTokens": 32768 } }}Veri işleme
Section titled “Veri işleme”Bu model Türkiye'de barındırılmaz. İstekler yurt dışındaki üçüncü taraf altyapı üzerinde işlenir ve istemler ile tamamlamalar sağlayıcı tarafından günlüğe kaydedilebilir. Gizli veya kişisel veri göndermeyin.