RAG ve veri rehberleri · 2026-08-28
Ling 3 Tiny ile uzun belgeler: bağlam, parçalama ve önbellek
Ling 3 Tiny ile uzun belge işlerken yerel bağlam sınırını, token bütçesini, kaynaklı parçalamayı ve prefix cache ile API cache farkını öğrenin.
Önce Tiny erişiminin kapsamını ayırın
Ling 3 Tiny ile uzun belge çalışmasında önce çalıştırdığınız sunucunun bağlam sınırını belirleyin; ardından belgeyi kaynakları korunmuş parçalara bölüp soruyla ilgili kanıtları seçin. Tekrarlanan sabit metinler için prefix cache yararlı olabilir. Ancak büyük bağlam, her ayrıntının doğru kullanılacağı veya belgenin tamamının her soruda gönderilmesi gerektiği anlamına gelmez.
InclusionAI'nin MIT lisanslı Tiny ağırlıkları yayımlanmış durumda. Buna karşılık LLMTR'deki inclusionai/ling-3.0-tiny API satırı 15 Ağustos 2026 tarihinde emekli edildi ve model_retired hatası döndürür. LLMTR'nin belirtilen halefi ücretli inclusionai/ling-3.0-flash modelidir. Aşağıdaki yerel belge tasarımı, eski Tiny API erişiminin yeniden açıldığı iddiası değildir.
128K ile 256K bilgisini aynı sınır sanmayın
28 Ağustos 2026 kontrolünde resmî Tiny config.json dosyasındaki max_position_embeddings değeri 131.072; SGLang kılavuzu da yerel bağlamı 128K olarak tanımlıyor. Model kartında ayrıca YaRN ayarıyla 262.144 bağlam isteyen bir sunucu örneği bulunuyor. Bu genişletme örneği, her kurulumda kendiliğinden açılan veya burada çalıştırılarak doğrulanmış bir sınır değildir.
Uygulama bütçesini model adındaki sayıya göre kurmayın. Kullandığınız checkpoint, çalışma zamanı sürümü ve sunucunun kabul ettiği etkin sınırı birlikte kaydedin. Donanım belleği ve eşzamanlı istekler yüzünden daha küçük bir sınır seçmeniz gerekebilir. Farklı kılavuzların sunucu seçeneklerini birleştirmeden tek bir belgelenmiş kurulumu izleyin.
Belgeye ayrılacak alanı baştan hesaplayın
Bağlam yalnızca belge değildir: sistem talimatı, sohbet şablonu, soru, önceki mesajlar ve üretilecek tokenlar da hesaba girer. Metni karakter veya sayfa sayısından tahmin etmek yerine kullandığınız modelin tokenizer'ıyla sayın. Şablon eklendikten sonraki toplamı kontrol edin; Türkçe metin için İngilizceye ait kelime başına token oranını kullanmayın.
Aşağıdaki tablo, sunucuyu 32.768 token sınırıyla çalıştırmayı seçtiğiniz varsayımsal bir bütçedir; Tiny için ölçülmüş çıktı tavanı değildir. Düşünme açıksa üretim payı hem düşünmeye hem son yanıta yeterli olmalıdır. Sabit kısım büyüdüğünde kanıt bütçesini aynı miktarda azaltın.
| Ayrılan alan | Token | İçerik |
|---|---|---|
| Sabit girdi | 3.000 | Talimat, şablon, soru ve gerekli geçmiş |
| Belge kanıtları | 23.672 | Seçilen parçalar ve kaynak etiketleri |
| Üretim | 4.096 | Düşünme ve son yanıt için ayrılan toplam |
| Güvenlik payı | 2.000 | Beklenmeyen şablon ve girdi büyümesi |
| Toplam | 32.768 | Bu örnekte seçilen çalışma sınırı |
Parçalama sırasında kanıtın adresini koruyun
Metin çıkarırken başlıkları, sayfa numaralarını ve tablo sütunlarını koruyun. Taranmış sayfalarda önce OCR çıktısını kontrol edin; bu akış Tiny'nin PDF dosyasını veya sayfa görselini doğrudan okuyabildiği varsayımına dayanmaz. Her parçaya belge kimliği, sürüm, bölüm ve sayfa aralığı ekleyin. Belgedeki talimatları uygulama komutu olarak değil, incelenecek veri olarak işleyin.
Parçaları başlık ve paragraf sınırlarından ayırın. Bir tanımı ilişkili istisnadan, tablo satırını sütun adından koparmayın. Örtüşen metin gerekiyorsa tekrar eden kısmı kaynak kimliğiyle tanıyıp son birleştirmede tekilleştirin. Tek bir maddeyi soran kullanıcı için ilgili bölümleri getirin; tüm belge özeti için bölüm özetlerini kaynaklarıyla çıkarıp ikinci aşamada birleştirin.
- Erişim iznini aramadan önce uygulayın; başka kullanıcıya ait belgeyi aday parçalar arasına almayın.
- Çelişen sürümleri ayrı tutun; en yeni dosyayı otomatik olarak tek doğru kabul etmeyin.
- Bulunmayan bilgiyi modelin tamamlaması yerine eksik alan olarak işaretleyin.
Prefix cache ile API cache ücretini ayırın
vLLM'nin otomatik prefix cache mekanizması, aynı başlangıç tokenlarını paylaşan isteklerde önceki hesaplamayı yeniden kullanır. Girdi işleme süresini azaltabilir; yeni yanıt tokenlarının üretimini aynı şekilde hızlandırmaz. Belgeyi önbelleğe almak bağlam sınırını da büyütmez.
Aynı belgeye farklı sorular sorarken sabit talimatı ve değişmeyen belgeyi başta, soruyu sonra tutun. Belge sürümü değiştiğinde eski içeriği yeniden kullanmayın. Yerel hesaplama önbelleği bir API fiyat kuralı değildir: emekli Tiny satırının geçmiş cache tarifesini yerel maliyet hesabına taşımayın. Bu yazıda cache isabeti veya gecikme ölçülmedi.
Özeti değil, kaynakla eşleşmeyi kontrol edin
Küçük bir kabul setinde doğrudan bilgi, iki bölümü birleştiren soru ve belgede cevabı olmayan soru bulunsun. Her yanıt için belirtilen sayfanın gerçekten iddiayı desteklediğini kontrol edin. Ayrıca kritik bir istisnayı başa, ortaya ve sona taşıyarak konum değişiminin sonucu etkileyip etkilemediğini inceleyin.
İşlem kaydında model sürümü, etkin bağlam sınırı, parça kimlikleri ve token sayıları yeterlidir; müşteri metnini veya model yanıtını üretim loglarına yazmayın. Kesilen yanıtları tamamlanmış kabul etmeyin. Kanıt eksikse önce getirme ve parçalama adımını düzeltin; bağlamı artırmayı tek çözüm olarak görmeyin.
Sık sorulan sorular
Ling 3 Tiny'ye belgenin tamamını göndermeli miyim?
Her zaman değil. Genel özet için bütün belge veya bölüm özetleri anlamlı olabilir. Belirli bir soruda ise ilgili parçaları, kaynak etiketlerini ve gerekli komşu bağlamı seçmek daha denetlenebilir bir başlangıçtır.
Önbellek açılırsa token bütçesine gerek kalır mı?
Hayır. Önceden işlenmiş metin de isteğin bağlamına dahildir. Cache hesaplamayı yeniden kullanabilir; belge, soru ve üretim toplamının sunucu sınırını aşmasına izin vermez.
Eski LLMTR Tiny kimliğiyle bu akışı çalıştırabilir miyim?
Hayır; o API satırı emeklidir. Tiny ağırlıklarıyla yerel sunucu kurmak ayrı bir seçenektir. LLMTR üzerinden devam edecekseniz belirtilen ücretli Flash halefinin fiyatını ve istek sözleşmesini ayrıca kontrol edin.