Entegrasyon rehberleri · 2026-09-22
Gemini TTS ile iki konuşmacılı diyalog seslendirme
Tek sesli uzun metin seslendirmeden farklı olarak, iki konuşmacılı bir diyaloğu nasıl kuracağınızı ve her konuşmacıya ayrı ses ataması yapmanın gerekliliğini anlatır.
Diyalog, tek sesli uzun metinden farklı bir kurulum ister
Gemini 2.5 Pro Preview TTS ile uzun metin seslendirme yazısında anlatıldığı gibi, tek bir sesle uzun bir metni seslendirirken temel iş metni cümle sınırlarında parçalara ayırmaktır. İki konuşmacının karşılıklı konuştuğu bir diyalog (örneğin bir podcast taslağı veya bir müşteri hizmetleri senaryosu) seslendirilirken ek bir katman devreye girer: her konuşmacının hangi sesle okunacağının sizin tarafınızda sabitlenmesi.
LLMTR'nin `/v1/audio/speech` ucu istek başına tek bir `voice` değeri alır; tek istekte iki konuşmacıya iki ayrı ses atayan bir alan bu uçta yoktur. Bütün diyaloğu tek istekte gönderirseniz tüm satırlar aynı sesle okunur.
Diyaloğu konuşmacı sırasına göre ayrı isteklerle seslendirin
Desteklenen yol, diyalog metnini konuşmacı değişimlerinden bölmek ve her parçayı o konuşmacıya atadığınız `voice` değeriyle ayrı bir istek olarak göndermektir. Dönen ses parçalarını diyalogdaki sırasıyla kendi tarafınızda birleştirirsiniz. Konuşmacı etiketi ile ses arasındaki eşlemeyi kodunuzda tek bir tabloda tutmak, her istekte doğru sesin seçilmesini garanti eder.
Bir konuşmacı için ses seçimi tutarlı kalmalıdır; aynı konuşmacının farklı bölümlerde farklı sesle okunması, dinleyicide kafa karışıklığı yaratır. Parçalar ayrı istekler olduğu için ses tonu ve tempo parçadan parçaya küçük farklar gösterebilir; birleştirmeden önce parçaların örnekleme hızının aynı olduğunu kontrol edin ve geçişlerde kısa bir sessizlik eklemeyi değerlendirin.
- Diyalog metnini konuşmacı değişimlerinden parçalara bölün.
- Her parçayı o konuşmacının `voice` değeriyle ayrı bir istek olarak gönderin.
- Dönen sesleri diyalog sırasıyla kendi tarafınızda birleştirin.
Çıktı biçimini doğrulayın
Tek sesli seslendirmede olduğu gibi, diyalog parçalarında da dönen sesin gerçek biçimini (örnekleme hızı, kanal sayısı) kontrol edip dosyayı buna göre kaydetmek gerekir; varsayılan bir biçim varsaymak, oynatılamayan veya bozuk bir ses dosyasıyla sonuçlanabilir.
Sık sorulan sorular
Kaç konuşmacıya kadar tek istekte seslendirme yapılabilir?
LLMTR üzerinden her istek tek bir sesle okunur. Konuşmacı sayısı istek başına değil, sizin birleştirme adımınızla sınırlıdır: her konuşmacıya bir ses atayıp parçaları sırayla seslendirerek iki veya daha fazla konuşmacılı bir diyalog kurabilirsiniz.
Her konuşmacı için farklı bir dil kullanabilir miyim?
Bu, seçtiğiniz seslerin dil desteğine bağlıdır. Bir diyalogda karma dil kullanmadan önce, atadığınız her sesin hedef dili desteklediğini ayrıca doğrulamanız gerekir.