Guías de integración · 2026-09-27

Narración en turco y español con Gemini 2.5 Pro Preview TTS

Prepara textos, elige una voz y revisa pronunciación en turco y español. No mezcles las solicitudes de Gemini 2.5 Pro TTS con parámetros de modelos posteriores.

Flujo TTS de LLMTR que lleva textos turcos y españoles a grabaciones separadas y después a una lista común de escucha.

Fija la versión y la tarea

Gemini 2.5 Pro Preview TTS genera audio a partir de texto. Registra el nombre completo al preparar una narración bilingüe: google/gemini-2.5-pro-preview-tts en LLMTR. No confundas un ejemplo general de chat con una solicitud de voz. Utiliza la ruta TTS documentada y no un flujo de conversación que espera texto.

La guía general de voz de Google reúne varias generaciones. No traslades automáticamente campos nuevos de metadata ni funciones de diseño de voz a 2.5 Pro. Este artículo propone un procedimiento para evaluar grabaciones turcas y españolas; no afirma haber generado audio ni medido la misma calidad en ambos idiomas. Escucha una muestra propia antes de publicarla.

Termina la traducción antes de generar audio

Comprueba por escrito que ambos guiones contienen la misma información. Pedir a la generación de voz que traduzca y pronuncie todo simultáneamente dificulta identificar errores. Revisa antes fechas, cifras, personas y productos. Genera cada idioma por separado para corregir uno sin rehacer el otro.

Define el público del texto español. El vocabulario regional y las formas de tratamiento deben resolverse durante la edición. Aclara abreviaturas y nombres con sufijos turcos. Las etiquetas de una interfaz visual pueden resultar confusas al escucharlas: utiliza frases cortas que expliquen qué debe hacer la persona. Los dos guiones no necesitan el mismo número de palabras para comunicar lo mismo.

Comprueba la voz con una solicitud breve

Utiliza model, input y voice en la solicitud TTS de LLMTR. Gemini TTS exige voice. Empieza con una frase corta y confirma que la respuesta se abre como audio. El cuerpo siguiente es una entrada de prueba, no una salida observada. Para el ensayo turco, cambia el texto conservando las condiciones iniciales.

No interpretes la respuesta como JSON de chat: este endpoint devuelve bytes de audio. Comprueba formato y reproducción. Que exista un archivo no demuestra que el trabajo esté terminado; también puede contener una grabación incorrecta, incompleta o silenciosa. En la primera escucha verifica el comienzo, el final y que se haya leído todo el guion.

Cuerpo breve para POST /v1/audio/speech

{
  "model": "google/gemini-2.5-pro-preview-tts",
  "input": "Hola. Esta grabación breve se ha preparado para comprobar la narración.",
  "voice": "Kore"
}

Escucha el efecto de las indicaciones

Si añades una indicación de lectura tranquila, clara o más lenta, no supongas que funcionó por aparecer en la solicitud. Escucha el efecto real. Si se lee la propia indicación, puede haber un problema de ubicación o interpretación. No inventes campos fuera del formato documentado para el modelo elegido.

Cambiar simultáneamente voz, texto, ritmo y puntuación dificulta comparar. Fija primero el guion y modifica una sola preferencia. Si utilizas una escritura auxiliar para pronunciar un nombre, no sustituyas con ella el texto original publicado. Separa cuando sea necesario el guion de producción y el contenido visible, y verifica al final que se mantengan el significado y los nombres.

Revisa cada idioma de forma independiente

Pide a alguien que entienda el idioma que revise cada grabación. Un sonido fluido no demuestra que cifras y nombres sean correctos. Marca fechas, importes decimales, códigos y abreviaturas. No supongas que la misma voz produce idéntico comportamiento de pronunciación en ambos idiomas. Cada uno debe cumplir sus propios criterios.

Anota el momento de cada segmento problemático para no revisar todo de nuevo al corregirlo. Asocia grabaciones con versión del guion e identificador del modelo, no solo con nombres de archivo. Si el segundo intento utiliza otro texto y suena mejor, no demuestra que se haya resuelto el problema del primer guion.

Control independiente de escucha por idioma
ÁreaPregunta de revisión
Significado¿Se omitió alguna parte?
Nombres¿La pronunciación es correcta y consistente?
Cifras¿Se entienden fechas e importes?
Ritmo¿Las pausas conservan el sentido?
Archivo¿Funcionan inicio, final y reproducción?

Amplía después de aprobar la muestra corta

Cuando la muestra sea aceptable, divide el texto largo en límites naturales. Cortar una frase o separar una cifra de su unidad puede empeorar la escucha. Mantén la voz y las convenciones editoriales entre segmentos. Escucha también el archivo unido: fragmentos correctos pueden producir repeticiones o transiciones bruscas al juntarse.

No estimes el coste solo por la duración final. Comprueba las unidades de precio y el consumo de todos los intentos; las regeneraciones también cuentan. Guarda versión y fecha cuando trabajes con un modelo preview. Repite las pruebas en ambos idiomas tras una migración. Aprobar la escucha del modelo anterior no aprueba automáticamente su sustituto, aunque la solicitud parezca similar.

Frequently asked questions

¿Gemini TTS necesita el campo voice?

Sí. LLMTR exige voice para Gemini TTS y rechaza con 400 las solicitudes que no lo incluyen.

¿Conviene traducir durante la generación de voz?

Esta guía propone revisar primero la traducción escrita y generar después el audio para distinguir errores de traducción y pronunciación.

¿Se ha medido aquí la calidad bilingüe?

No. Es un método de producción y revisión. Genera tus propios textos y revisa cada idioma de forma independiente.

Artículos relacionados