İçeriğe geç

InclusionAI Ling 3.0

Ling 3.0, InclusionAI'nin Mixture-of-Experts model ailesidir. LLMTR üzerinde /v1/chat/completions ile çağrılır.

ModelBağlamMaksimum çıktıGiriş / Cache okuma / Çıkış ($/1M)
inclusionai/ling-3.0-flash262.14432.7680.06 / 0.012 / 0.18
inclusionai/ling-3.0-flash-fin262.14432.7680 / 0 / 0
inclusionai/ling-3.0-tiny15 Ağustos 2026'da emekli edildi

Flash, 124 milyar parametreli modeldir; token başına yaklaşık 5,1 milyarı çalışır. Ajan iş akışlarında token verimliliği hedefiyle eğitilmiştir.

Flash Fin, aynı modelin finans alanına göre eğitilmiş sürümüdür; çok adımlı yatırım araştırması ve uzun soluklu planlama için ayarlanmıştır ve ücretsiz sunulur. Davranışının Flash'tan ayrıldığı iki nokta için Ling 3.0 Flash Fin bölümüne bakın.

Varsayılan olarak düşünür ve düşünce zincirini yanıtta reasoning_content alanında ayrı döndürür; content nihai cevabı taşır.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "inclusionai/ling-3.0-flash",
"messages": [
{ "role": "user", "content": "Bu fonksiyondaki hatayı bul." }
],
"max_tokens": 8192
}'

Flash'ta düşünme reasoning_effort alanıyla denetlenir ve desteklenen tek değer none'dır. Model kimliğine :none soneki de eklenebilir:

inclusionai/ling-3.0-flash -> düşünme açık (varsayılan)
inclusionai/ling-3.0-flash:none -> düşünme kapalı
Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "inclusionai/ling-3.0-flash",
"messages": [{ "role": "user", "content": "17 * 23 kaç eder?" }],
"reasoning_effort": "none",
"max_tokens": 512
}'

Sağlayıcı minimal, low, medium, high, xhigh ve max değerlerini de kabul eder, ancak ölçümde bu değerler düşünme uzunluğunu düzenli biçimde değiştirmemiştir: sabit bir istem üzerinde seviye başına üç örnekte max 809-1366 karakter düşünürken medium 2323-4524 karakter düşünmüştür. Aralıklar birbirinin içine geçtiği için bunlar bir kademe oluşturmaz. Etkisi olmayan bir seviyeyi sunmak, sizi değiştirmediği bir ayar için düşünme tokenı ödemeye bırakırdı.

Bu nedenle none dışında bir seviye gönderen istekler 400 ile reddedilir ve hata mesajı desteklenen değerleri listeler. Kademeli denetim sunan modeller için Reasoning Effort sayfasına bakın.

:fast ve :think sonekleri Flash'ta geçerli değildir ve 400 döner. Bu sonekler emekli edilen Tiny satırına özgüydü.

Düşünme tokenları da çıktıdır ve completion_tokens içinde döner. Flash bazı istemlerde uzun uzun düşünebilir; ölçümde bazı istemlerde düşünce reasoning_content yerine doğrudan content içine yazılmış ve yanıt finish_reason: "length" ile bütçeyi tüketmiştir. Aynı istem reasoning_effort: "none" ile birkaç tokende doğru cevabı vermiştir.

Kısa ve kesin cevap gerektiğinde none hem hızlı hem ucuzdur. Düşünmeye ihtiyacınız varsa max_tokens değerini bol — ancak 32.768'i aşmayacak şekilde — tutun.

inclusionai/ling-3.0-flash-fin, Flash ile aynı mimariyi (124B MoE, token başına ~5,1B aktif), aynı 262.144 tokenlık bağlamı ve aynı 32.768 tokenlık çıktı tavanını paylaşır. Fark, modelin finans alanına göre eğitilmiş olması ve ücretsiz sunulmasıdır.

Ücretsiz satırlar günlük kullanım kotasıyla çalışır. Kota dolduğunda çağrı 429 ile reddedilir ve hata gövdesi ne zaman yeniden deneyebileceğinizi söyler; ücretli modeller bundan etkilenmez.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "inclusionai/ling-3.0-flash-fin",
"messages": [
{ "role": "user", "content": "Bir tahvilin temiz fiyatını nasıl hesaplarım?" }
],
"max_tokens": 8192
}'

Flash ile aynıdır: reasoning_effort alanı kabul edilir ve desteklenen tek değer none'dır. Model kimliğine :none soneki de eklenebilir.

inclusionai/ling-3.0-flash-fin -> düşünme açık (varsayılan)
inclusionai/ling-3.0-flash-fin:none -> düşünme kapalı

Sağlayıcı minimal, low, medium, high, xhigh ve max değerlerini de kabul eder, ancak ölçümde bu değerler düşünme uzunluğunu düzenli biçimde değiştirmemiştir: sabit bir istem üzerinde minimal 3312-4196 karakter düşünürken low 1956-2840 karakter düşünmüştür. Aralıklar birbirinin içine geçtiği için bunlar bir kademe oluşturmaz ve sunulmaz; none dışında bir seviye gönderen istekler 400 ile reddedilir.

tool_choice düşünme kapalıyken kısıtlıdır

Section titled “tool_choice düşünme kapalıyken kısıtlıdır”

Bu satırın Flash'tan ayrıldığı tek davranış budur. Düşünme kapalıyken model tool_choice alanındaki required ve adlandırılmış fonksiyon seçimlerini yerine getirmez: ölçümde bu birleşim 12 çağrının 12'sinde 200 döndü, finish_reason stop oldu ve yanıtta hiç araç çağrısı bulunmadı. Düşünme açıkken aynı çağrıların 12'si de araç çağırdı.

Sessizce düz metin dönen bir required, ajan döngüsünde teşhisi en zor hata biçimidir. Bu yüzden LLMTR bu birleşimi sağlayıcıya göndermeden 400 ile reddeder:

{
"error": {
"message": "\"inclusionai/ling-3.0-flash-fin\" ignores \"required\" for tool_choice when reasoning is disabled and answers in prose instead, so the request is refused rather than silently returning no tool call. Either keep reasoning on (drop `reasoning_effort: \"none\"` and the `:none` suffix), or send `tool_choice: \"auto\"` and let the model decide.",
"type": "invalid_request",
"details": {
"reason": "tool_choice_requires_reasoning",
"model": "inclusionai/ling-3.0-flash-fin"
}
}
}

İki çıkış yolu vardır ve hangisinin doğru olduğu neye öncelik verdiğinize bağlıdır: araç çağrısını zorunlu kılmanız gerekiyorsa düşünmeyi açık bırakın, düşünme kapalı çalışmanız gerekiyorsa tool_choice alanını auto yapın. auto her iki durumda da çalışır.

Fin de tekrarlanan önekleri prompt cache'ten okur ve cache'ten okunan token sayısı usage.prompt_tokens_details.cached_tokens alanında döner. Satır ücretsiz olduğu için cache burada bir maliyet avantajı değil, gecikme avantajıdır.

inclusionai/ling-3.0-tiny 15 Ağustos 2026 tarihinde emekli edilmiştir. Sağlayıcı modeli kendi kataloğundan çekti; bu LLMTR'nin kararı değildir ve geri alınabilir bir durum değildir.

Bu kimliğe gönderilen istekler 410 model_retired döner. Hata gövdesi emeklilik tarihini ve yerine kullanabileceğiniz modeli içerir:

{
"error": {
"message": "Model \"inclusionai/ling-3.0-tiny\" was retired on 2026-08-15. Use \"inclusionai/ling-3.0-flash\" instead.",
"type": "model_retired",
"details": {
"model": "inclusionai/ling-3.0-tiny",
"replacement_model": "inclusionai/ling-3.0-flash",
"retirement_date": "2026-08-15"
}
}
}

İstekleriniz sessizce başka bir modele yönlendirilmez. Tiny ücretsizdi, yerine önerilen Flash ise ücretlidir; ücretsiz olduğu için seçtiğiniz bir çağrının haberiniz olmadan faturalanmaya başlaması kabul edilebilir bir davranış değil. Bu yüzden model kimliğini kendiniz değiştirirsiniz.

Ücretsiz bir model arıyorsanız katalogda ücretsiz satırlar bulunmaya devam ediyor; model listesinde "Free" etiketiyle görünürler.

Tiny'ye özgü olan :fast / :think sonekleri ve reasoning boolean alanı da bu satırla birlikte kalkmıştır. Flash'ta düşünme denetimi yukarıdaki reasoning_effort: "none" ile yapılır.

Her iki model de araç/fonksiyon çağrısını yerel olarak destekler. tools dizisini standart OpenAI biçiminde verirsiniz; Flash'ta tool_choice alanının auto, required ve adlandırılmış fonksiyon biçimlerinin üçü de çalışır.

Flash Fin'de required ve adlandırılmış fonksiyon yalnızca düşünme açıkken çalışır; ayrıntı ve hata gövdesi için Ling 3.0 Flash Fin bölümüne bakın.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "inclusionai/ling-3.0-flash",
"messages": [{ "role": "user", "content": "İstanbul hava durumu ne?" }],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"description": "Verilen şehrin güncel hava durumunu döndürür.",
"parameters": {
"type": "object",
"properties": { "city": { "type": "string" } },
"required": ["city"]
}
}
}],
"max_tokens": 4096
}'

Genel akış için Araç Çağrısı sayfasına bakın.

Aynı önek yeniden gönderildiğinde sağlayıcı prompt cache uygulayabilir ve cache'ten okunan token sayısı usage.prompt_tokens_details.cached_tokens alanında döner.

Bu doğrudan bir maliyet avantajıdır: cache'ten okunan tokenlar 1M başına 0,012 $ ile faturalanır, normal giriş fiyatının beşte biri. Uzun ve sabit bir sistem istemiyle çalışan ajanlarda fark belirgindir.

Cache isabeti garanti değildir; aynı önek art arda gönderildiğinde ilk çağrı ısınma sayılır ve isabet sonraki çağrılarda başlar.

Flash yalnızca metin kabul eder. Aşağıdakiler 400 ile reddedilir:

  • Görsel girdi (image_url içerik parçası)
  • Ses girdisi (input_audio içerik parçası)
  • response_format ile json_object veya json_schema

Şema zorunlu JSON çıktısı gerekiyorsa bunu destekleyen bir model seçin; bu modelden JSON'u istem içinde isteyebilirsiniz ancak biçim garanti edilmez.

Bağlam penceresi 262.144 token, tek yanıtta üretilebilecek en fazla çıktı 32.768 tokendır. Girdi ve çıktı aynı bağlam bütçesini paylaşır, bu yüzden max_tokens değerini pencerenin tamamına ayarlamayın.

max_tokens (veya max_completion_tokens) 32.768'in üzerindeyse istek sağlayıcıya gönderilmeden LLMTR tarafından 400 invalid_request ile reddedilir. Hata gövdesi sınırı ve gönderdiğiniz değeri içerir:

{
"error": {
"message": "\"inclusionai/ling-3.0-flash\" can return at most 32,768 tokens in one response, but \"max_tokens\" was 100,000. Lower it to 32,768 or below.",
"type": "invalid_request",
"details": {
"reason": "max_output_tokens_exceeded",
"field": "max_tokens",
"requested": 100000,
"maxOutputTokens": 32768
}
}
}

Bu model Türkiye'de barındırılmaz. İstekler yurt dışındaki üçüncü taraf altyapı üzerinde işlenir ve istemler ile tamamlamalar sağlayıcı tarafından günlüğe kaydedilebilir. Gizli veya kişisel veri göndermeyin.