InclusionAI / inclusionai/ling-3.0-flash

Ling 3.0 Flash - LLMTR üzerinden erişim

Ling 3.0 Flash, InclusionAI'nin 124 milyar parametreli Mixture-of-Experts modelidir; token basina yaklasik 5,1 milyar parametre calisir. Ajan is akislarinda token verimliligi hedefiyle egitilmistir: arac cagrisini yerel olarak destekler, tekrarlanan onekleri prompt cache'ten okur ve 256K baglam penceresi sunar. Varsayilan olarak dusunur; dusunce zinciri yanitta `reasoning_content` alaninda ayri doner ve tokenlari `completion_tokens` icinde sayilir. Dusunmeyi kapatmak icin `reasoning_effort` alanini `none` gonderin ya da model kimligine `:none` sonekini ekleyin - bu modelde etkisi olculmus tek seviye budur, diger seviyeler kabul edilse de dusunme uzunlugunu duzenli sekilde degistirmez ve bu yuzden sunulmaz. Cikti tek seferde en fazla 32.768 token olabilir. Yalnizca metin kabul eder; gorsel, ses ve sema zorlamali JSON ciktisi desteklemez. Dusunme acikken model bazi istemlerde uzun uzun dusunup butceyi tuketebilir; kisa ve kesin cevap gerektiginde `none` seviyesi hem hizli hem ucuzdur.

Teknik özellikler

Canonical IDinclusionai/ling-3.0-flash
SağlayıcıInclusionAI
Context penceresi262.144 tokens
OperasyonlarCHAT_COMPLETIONS
Modalitelertext

Fiyatlandırma

Kredi yüklemede %8 platform marjı uygulanır; model kullanım fiyatları ayrıca yükseltilmez.

OperationMetricUnitPrice
CHAT_COMPLETIONSINPUT_TEXTPER_1M_TOKENS$0.060000
CHAT_COMPLETIONSCACHE_READPER_1M_TOKENS$0.012000
CHAT_COMPLETIONSOUTPUT_TEXTPER_1M_TOKENS$0.180000

Örnek kullanım

Mevcut OpenAI SDK akışında yalnızca base URL ve model kimliğini değiştirirsiniz.

curl https://llmtr.com/v1/chat/completions \
  -H "Authorization: Bearer llmtr-your_key" \
  -H "Content-Type: application/json" \
  -d '{"model":"inclusionai/ling-3.0-flash","messages":[{"role":"user","content":"Hello"}]}'

İlgili modeller