Model karşılaştırma · 2026-08-28
Ling 3.0 Tiny mimarisi: toplam ve aktif parametre farkı
Ling 3.0 Tiny'nin 7,9B toplam ve 1,3B aktif parametresini, MoE uzman seçimini ve KDA–MLA mimarisini bellek ve performans açısından okuyun.
Ling 3.0 Tiny kaç parametreli?
Ling 3.0 Tiny, InclusionAI'nin yaklaşık 7,9 milyar toplam parametreye sahip bir MoE dil modelidir; resmî model kartına göre her token için yaklaşık 1,3 milyar parametre etkinleşir. Bu nedenle model hem 7,9B toplam hem 1,3B aktif olarak tanımlanabilir. İki sayı farklı soruları yanıtlar: modelde kaç ağırlık bulunduğu ve tek bir tokenın hesaplanmasına bunların ne kadarının katıldığı.
Aktif sayının küçük olması, kalan ağırlıkların modelden çıkarıldığı anlamına gelmez. Farklı tokenlar farklı uzmanlardan yararlanabilir. Bu yüzden Tiny'yi yalnızca 1,3 milyar parametreli yoğun bir model gibi sınıflandırmak da bütün ağırlıkları her token için kullanan bir 7,9B modelle eşitlemek de karşılaştırmayı eksik bırakır.
MoE uzmanları token için nasıl seçer?
MoE, uzman karışımı anlamına gelir. Buradaki uzmanlar ayrı sohbet botları değil, model içindeki ileri beslemeli sinir ağı bileşenleridir. Yönlendirici, tokenın o katmandaki temsilinden seçim puanları üretir. Seçilen uzmanların çıktıları ağırlıklandırılarak birleştirilir; paylaşılan uzmanın katkısı da eklenir. Kullanıcının bir uzman adı seçmesi gerekmez.
| Mimari ölçüsü | Ling 3.0 Tiny | Nasıl yorumlanmalı? |
|---|---|---|
| Toplam parametre | Yaklaşık 7,9 milyar | Modelin bütün ağırlıklarını ifade eder |
| Token başına aktif parametre | Yaklaşık 1,3 milyar | Tek tokenın hesaplama yolunu tanımlar |
| MoE katmanındaki yönlendirilen uzman | 128 | Seçimin yapıldığı uzman havuzudur |
| Token başına seçilen uzman | 8 yönlendirilen + 1 paylaşılan | Tüm uzmanlar aynı token için çalışmaz |
| Dikkat katmanı düzeni | 3 KDA + 1 MLA | Her dört katmanlık dikkat bloğunun düzenidir |
KDA ve MLA neden birlikte kullanılıyor?
Tiny, üç Kimi Delta Attention katmanını bir Multi-head Latent Attention katmanıyla birleştirir. KDA lineer dikkat ailesindedir; MLA ise gizil temsilden yararlanan tam dikkat yaklaşımıdır. Böylece mimari, bağlamı işlemek için tek bir dikkat biçimine dayanmaz. Bu, MoE uzman seçiminden ayrı bir tasarım kararıdır: biri dikkat hesabını, diğeri ileri beslemeli hesabın hangi uzmanlardan geçeceğini düzenler.
Buradan çıkarılabilecek sonuç, aynı toplam parametreyi taşıyan iki modelin aynı hesaplama yapısını kullanmayacağıdır. Ancak katman oranından belirli bir hızlanma veya belge anlama başarısı çıkarılamaz. Bir görevde uzun metni doğru kullanma becerisi ayrıca değerlendirilmelidir; mimari adı başarı ölçümünün yerine geçmez.
1,3B aktif parametre bellek ihtiyacı değildir
Toplam ve aktif sayıların oranı yaklaşık yüzde 16,5'tir. Bu aritmetik oran, Tiny'nin başka bir modelden altı kat hızlı çalışacağını söylemez. Dikkat işlemleri, uzman yönlendirme, bellek aktarımı ve çalışma zamanı uygulaması gecikmeye ayrıca katkıda bulunur. Giriş metninin işlenmesi ile yeni token üretilmesi de ayrı ölçülmelidir.
Bellek planında yalnızca etkinleşen uzmanları saymak yeterli değildir. Ağırlıkların tutulması veya taşınması, isteklerin ara durumları, önbellekler ve çalışma zamanı için alan gerekir. Eşzamanlı istek sayısı da değerlendirmeye katılmalıdır. Parametre sayısından tek başına asgari RAM veya VRAM değeri üretmeyin.
Resmî BF16, FP8 ve INT4 ağırlıkları bulunur. Bunlar sayısal temsil seçenekleridir; toplam ve aktif parametre ayrımını ortadan kaldırmaz. Daha düşük hassasiyetin kaliteye ve gerçek çalışma belleğine etkisi, seçilen uygulamayla ölçülmelidir.
Karşılaştırmayı gerçek görevle kurun
Örneğin bir destek mesajından konu, aciliyet ve gerekli takip sorusunu çıkarmak istiyorsanız değerlendirmeyi bu üç alan üzerinden tasarlayın. Bir modelin daha çok parametresi olması, sizin etiketlerinize veya Türkçe metinlerinize daha iyi uyacağını tek başına göstermez.
Aşağıdaki kontrol listesi bir deney planıdır; burada gerçekleştirilmiş bir benchmark veya model yanıtı değildir.
- Kişisel veri içermeyen aynı Türkçe ve İngilizce örnekleri bütün adaylara verin.
- Ağırlık sürümünü, sayısal hassasiyeti, çalışma zamanı sürümünü ve donanımı kaydedin.
- Düşünme ayarını ve çıktı bütçesini karşılaştırılabilir tutun.
- Doğru alan çıkarma, eksik bilgi ve gereksiz tahminleri ayrı değerlendirin.
- İlk token süresini, tamamlanma süresini, tepe belleği ve eşzamanlı istek yükünü birlikte ölçün.
Mimari bilgisi erişim durumunu değiştirmez
28 Ağustos 2026 itibarıyla InclusionAI'nin resmî Tiny ağırlık depoları erişilebiliyor ve model kartları MIT lisansını belirtiyor. LLMTR'deki inclusionai/ling-3.0-tiny API kimliği ise 15 Ağustos 2026 tarihinden itibaren emeklidir ve model_retired hatasıyla karşılanır. Bu, model ağırlıklarının ortadan kalktığı anlamına gelmez.
LLMTR'nin bu kimlik için belirlediği halef ücretli inclusionai/ling-3.0-flash modelidir. Yerel Tiny çalıştırmak ayrı bir donanım ve yazılım değerlendirmesidir. Bu yazı mimariyi açıklar; kurulumun veya canlı API erişiminin test edildiğini iddia etmez.
Sık sorulan sorular
Ling 3.0 Tiny 7,9B mi, 1,3B mi?
İkisi de farklı ölçülerle doğrudur: yaklaşık 7,9B toplam parametre vardır, token başına yaklaşık 1,3B parametre etkinleşir. Model kartındaki toplam ve aktif alanlarını birlikte okuyun.
Sekiz uzman seçilmesi neden yüzde 6,25 aktif parametre demek değil?
8/128 yalnızca yönlendirilen uzmanların sayısal oranıdır. Paylaşılan uzman ve modelin diğer bileşenleri bu oranda yer almaz; toplam aktif parametre oranıyla eşitlenemez.
MoE uzmanı bir aracı veya başka modeli mi çağırır?
Hayır. Uzman yönlendirme sinir ağının iç hesabıdır. Haricî araç çağırma ise uygulamanın ayrıca yürüttüğü farklı bir iş akışıdır.
Aktif parametre sayısından bilgisayarımda çalışıp çalışmayacağını anlayabilir miyim?
Hayır. Ağırlık biçimi, çalışma zamanı desteği, kullanılabilir bellek, bağlam ve eşzamanlılık birlikte değerlendirilmelidir. Bu yazıda donanım üzerinde çalıştırma testi yapılmadı.