Entegrasyon rehberleri · 2026-09-22
Ling 3.0 Flash'ı vLLM ile üretime almak: donanım ve batch ayarları
Tiny'nin küçük ölçekli vLLM kurulumundan farklı olarak, Flash'ı üretim ölçeğinde vLLM ile sunarken donanım paylaşımı ve batch ayarlarının nasıl kurulacağını anlatır.
Tekli sunucu kurulumu ile üretim ölçeği farklı sorular
Ling-3.0-Tiny yerel API yazısında ele alınan vLLM kurulumu, model yolu ve istemci kimliğinin eşleşmesine odaklanan tekli sunucu senaryosudur. Flash'ı üretim trafiği taşıyan bir servis olarak vLLM ile sunmak, ek iki soruyu gündeme getirir: model tek bir GPU'ya sığmıyorsa donanımı nasıl paylaştıracağınız ve eş zamanlı gelen istekleri nasıl verimli işleyeceğiniz.
Bu, Flash'ın Ollama/MLX üzerinde yerel deneme yapılabilirliğini ele alan yazıdan da farklı bir konudur; o yazı tek bir cihazda denemeye odaklanırken bu yazı çok sayıda isteği aynı anda karşılayan bir üretim dağıtımını ele alır.
Donanım paylaşımı: tensor parallelism
Model tek bir GPU'nun belleğine sığmadığında, vLLM'in tensor parallelism özelliği modeli birden fazla GPU'ya bölerek dağıtmanızı sağlar; bu, tek bir büyük GPU almak yerine birden fazla orta ölçekli GPU'yu bir araya getirerek de üretime çıkabileceğiniz anlamına gelir. Kaç GPU'ya ihtiyaç duyduğunuz, modelin niceleme (quantization) düzeyine ve seçtiğiniz bağlam penceresi uzunluğuna bağlı olarak değişir; bu yüzden kesin bir GPU sayısı vermek yerine, kendi donanımınızda küçük bir yük testiyle doğru yapılandırmayı bulmanız gerekir.
Niceleme düzeyini düşürmek gereken GPU belleğini azaltır, ancak yanıt kalitesini etkileyebilir; üretime almadan önce niceleme düzeyinin görev kaliteniz üzerindeki etkisini kendi örneklerinizle test etmeniz gerekir.
- Model tek GPU'ya sığmıyorsa tensor parallelism ile birden fazla GPU'ya bölün.
- GPU sayısı niceleme düzeyine ve bağlam penceresi uzunluğuna göre değişir; kendi donanımınızda test edin.
- Niceleme, GPU belleğini azaltır ama kaliteyi etkileyebilir; üretim öncesi doğrulayın.
Sürekli batch (continuous batching) ile eş zamanlı istek
vLLM'in sürekli batch mekanizması, farklı zamanlarda gelen istekleri tek tek sırayla işlemek yerine, devam eden isteklerin arasına yeni gelen istekleri dinamik olarak ekleyerek GPU kullanımını artırır. Bu ayar doğru yapılandırılmadığında, düşük trafikte sorun görünmeyebilir ama trafik arttıkça istekler arasında beklenmedik gecikme artışları ortaya çıkabilir; bu yüzden üretime almadan önce beklenen eş zamanlı istek sayısına yakın bir yük testi yapmak gerekir.
Sık sorulan sorular
Flash'ı üretime almadan önce kaç GPU gerektiğini nasıl öğrenirim?
Kesin bir sayı vermek mümkün değildir; niceleme düzeyi ve bağlam penceresi uzunluğunuza bağlıdır. Kendi donanımınızda küçük bir yük testiyle, hedeflediğiniz gecikme ve verim düzeyini karşılayan yapılandırmayı bulmanız gerekir.
Tiny için işe yarayan tekli sunucu kurulumu Flash'ta da yeterli mi?
Düşük trafikli bir deneme için yeterli olabilir, ama üretim trafiği taşıyacaksa donanım paylaşımı ve sürekli batch ayarlarını ayrıca değerlendirmeniz gerekir; Tiny'nin tekli kurulumu bu ihtiyaçları kapsamaz.