Mejores prácticas de Gemini TTS: Genera audio consistente y expresivo cada vez
Resumen rápido: Los modelos Gemini TTS (2.5 Flash, 2.5 Pro y 3.1 Flash) son fundamentalmente diferentes del TTS tradicional: son modelos de lenguaje grande que generan audio. Esto significa que tus avisos, selección de voz y etiquetas en línea tienen un impacto enorme en la calidad de salida. Esta guía cubre los cinco pilares de una generación de audio consistente: Preajustes, selección de voz, etiquetas de emoción, avisos del sistema y barandillas.
Indicación de estilo (Instrucción del sistema)
El impulsor principal del tono emocional general y el estilo de entrega. Establece el contexto para todo el segmento de discurso.Contenido de texto (Transcripción)
El significado semántico de las palabras. Un texto emocionalmente rico y evocador produce resultados mucho más fiables que un texto neutral.Etiquetas en línea (Markup)
Modificadores entre corchetes como [whispers] o [laughs] para un control granular y localizado sobre frases específicas. Funcionan en conjunto con la indicación de estilo.
Principio clave: Para una máxima previsibilidad, asegúrese de que su indicación de estilo, contenido de texto y etiquetas en línea sean semánticamente consistentes y trabajen hacia el mismo objetivo emocional. Una indicación asustada con un texto neutral de programación de reuniones producirá resultados ambiguos.
# PERFIL DE AUDIO: Nova ## "La anfitriona de la mañana" ## LA ESCENA: Estudio de transmisión de radio en vivo [Un estudio cálido y acogedor con una suave luz matutina. Nova está relajada, segura y atractiva — ella habla directamente al oyente como a una amiga.] ### NOTAS DEL DIRECTOR Estilo: Cálido, conversacional, ligeramente optimista Ritmo: Medio — no apresurado, no lento Acento: Inglés americano, neutral Tono: Amistoso y accesible, como hablar con un amigo cercano tomando un café
- Reproducibilidad: El mismo preajuste aplicado a diferentes transcripciones producirá audio que suene como el mismo hablante en la misma sesión.
- Flujos de trabajo con múltiples hablantes: Defina un preajuste por hablante (entrevistador, invitado, narrador) y mantenga voces distintas en todos los episodios.
- Reducción de la deriva de las indicaciones: Sin un preajuste, el modelo infiere el estilo solo del texto, lo que conduce a inconsistencias en proyectos largos.
- Iteración más rápida: Una vez que su preajuste suene bien, solo necesita ajustar la transcripción, no reinventar la voz cada vez.
- Dale un nombre al personaje. Anclar el modelo con un nombre ("Nova", "Dr. Claire", "Marcus") une la actuación y reduce el extravío.
- Define la identidad, no solo el tono. "DJ de radio" o "narrador de documentales de naturaleza" le da al modelo un arquetipo de actuación al que anclarse.
- Sé específico sobre el entorno. "Cafetería ocupada temprano en la mañana" vs. "estudio tranquilo" produce perfiles acústicos significativamente diferentes en el resultado.
- Incluye "notas del director". El estilo, el ritmo, el acento y el tono deben abordarse explícitamente — no los deje al azar.
- Mantenga los preajustes por debajo de 200 palabras. Los preajustes más largos corren el riesgo de diluir el enfoque del modelo. Sea conciso pero específico.
| Nombre de la voz | Género | Mejor para | Características |
|---|---|---|---|
| Kore | Femenino | Narración cálida, podcasts | Amistosa, cálida, accesible |
| Puck | Masculino | Contenido animado, promociones | Enérgico, seguro |
| Enceladus | Masculino | Narración tranquila, audiolibros | Susurrante, introspectivo |
| Charon | Masculino | Contenido autoritario | Profundo, dominante |
| Aoede | Femenino | Presentaciones profesionales | Claro, pulido |
| Callirrhoe | Femenino | Conversación informal | Ligero, natural |
| Orus | Masculino | Contenido técnico | Preciso, medido |
| Fenrir | Masculino | Narración dramática | Potente, intenso |
- Combina la voz con el estilo del preajuste. Si su preajuste describe a un personaje cansado, elija una voz con aire natural (como Enceladus). No le pida a una voz brillante y optimista que susurre — sonará forzado.
- Pruebe la [Voice Library] en Google AI Studio. El patio de recreo le permite escuchar cómo cada voz responde a diferentes indicaciones antes de comprometerse.
- Use la sinergia de voz + indicación. Una voz masculina profunda (Charon) combinada con una indicación de estilo autoritario amplifica el efecto. La voz y la indicación deben reforzarse mutuamente.
- Evite indicaciones de edad/género no coincidentes. Una voz masculina profunda que intenta sonar como una niña pequeña produce resultados extraños. Asegúrese de que el tono escrito de su preajuste se adapte naturalmente a la voz.
- Bloquee una voz por personaje. En contenido con múltiples hablantes, asigne una voz por hablante y nunca la cambie a mitad del proyecto. La consistencia es clave.
- Para contenido que no esté en inglés: Use la misma voz en todos los idiomas para una identidad de marca consistente. Gemini TTS maneja más de 70 idiomas con las mismas opciones de voz.
Consejo profesional: Al usar la API de Google Cloud TTS (Vertex AI), también puede especificar speaker por voz. Combine esto con el modo de diálogo para múltiples hablantes para una diarización automática de hablantes en podcasts y entrevistas.
| Etiqueta | Efecto | Fiabilidad |
|---|---|---|
| [sigh] | Inserta un sonido de suspiro | Alta |
| [laughing] | Inserta una risa | Alta |
| [uhm] | Inserta una vacilación | Alta |
| [gasp] | Inserta un sonido de jadeo | Alta |
| [cough] | Inserta un sonido de tos | Media |
| [sighs] | Inserta un suspiro | Alta |
| Etiqueta | Efecto | Fiabilidad |
|---|---|---|
| [whispers] | Locución susurrada | Alta |
| [excitedly] | Tono emocionado y enérgico | Alta |
| [bored] | Entrega plana y desinteresada | Alta |
| [a regañadientes] | Tono vacilante y poco dispuesto | Alta |
| [con calma] | Entrega relajada y medida | Alta |
| [gritando] | Voz fuerte y proyectada | Medio-Alto |
| [noticiero] | Estilo de periodismo de radiodifusión | Alta |
| [documental] | Narrador de documentales sobre la naturaleza | Alta |
| [conversacional] | Entrega informal y natural | Alta |
| Etiqueta | Efecto | Fiabilidad |
|---|---|---|
| [lentamente] | Ritmo más lento | Alta |
| [rápidamente] | Ritmo más rápido | Alta |
| [pausa] | Breve pausa antes de continuar | Alta |
| [pausa larga] | Pausa extendida | Alta |
| [énfasis] | Enfatiza la siguiente frase | Medio-Alto |
// Predeterminado — sin etiquetas Hola, soy un nuevo modelo de texto a voz. ¿Cómo puedo ayudarte hoy? // Entusiasmado [excitedly] Hola, soy un nuevo modelo de texto a voz! ¿Cómo puedo ayudarte hoy? // Aburrido [bored] Hola, soy un nuevo modelo de texto a voz... ¿Cómo puedo ayudarte hoy? // Sarcástico con pausa [sighs] Hola... [pause] Soy un nuevo modelo de texto a voz. [pause] ¿Cómo puedo ayudarte hoy? // Susurrado con risa [whispers] Hola... [laughing] Soy un nuevo modelo de texto a voz. ¿Cómo puedo ayudarte hoy?
- Usa etiquetas para acciones localizadas, no para el tono general. Establece el tono general con tu instrucción de sistema. Usa etiquetas para momentos específicos: una risa en un punto, un susurro en otro.
- No abuses de las etiquetas. Demasiadas etiquetas en un pasaje corto pueden sonar poco naturales. Usa un máximo de 1-2 etiquetas por párrafo.
- Usa etiquetas en inglés incluso para transcripciones que no estén en inglés. Google recomienda etiquetas en inglés para obtener mejores resultados, independientemente del idioma hablado.
- Sé creativo — no hay una lista exhaustiva. El modelo interpreta el lenguaje natural entre corchetes. Prueba con [playful], [melancholy], [urgently], [with a grin]; el modelo hará lo mejor que pueda.
- Prueba primero las etiquetas nuevas. Una etiqueta que asumas que es un modificador de estilo podría vocalizarse como texto literal. Prueba siempre en el entorno de pruebas de AI Studio.
- Alinea las etiquetas con la instrucción y el texto. Una etiqueta [cheerful] en un contexto donde la instrucción de estilo dice "triste y reflexivo" producirá un resultado contradictorio.
Eres un guionista y director de audio. Tengo un contexto simple pero NO TENGO TRANSCRIPCIÓN. TAREA: 1. Escribe un guion creativo y atractivo basado en el contexto dado. 2. Formatea toda la salida como una instrucción de TTS estructurada. FORMATO DE SALIDA ESTRICTO: # PERFIL DE AUDIO: [Name] ## "[Title]" ## LA ESCENA: [Scene Title] [Descripción vívida] ### NOTAS DEL DIRECTOR Estilo: [Style] Ritmo: [Pace] Acento: [Accent]
- Sé específico, no genérico. "Habla como un locutor de noticias de radio de los años 40" produce resultados mucho mejores que "habla de forma anticuada".
- Prepara la escena. El contexto ambiental ("aeropuerto concurrido", "estudio silencioso", "cafetería por la mañana temprano") guía la interpretación acústica del modelo.
- Define el estado emocional del personaje. "Nova está relajada y segura de sí misma" le da al modelo una base emocional inicial para cada línea.
- Incluye detalles paralingüísticos. Menciona la respiración, el ritmo, las pausas y la textura vocal. "Voz ligeramente jadeante, ritmo pausado con pausas naturales" es más accionable que solo "calma".
- Usa la misma instrucción para contenido relacionado. Si estás generando una serie de episodios de un podcast, la instrucción de sistema debe ser idéntica en todos ellos.
- Deja que Gemini codirija. Si te bloqueas, dale a Gemini un contexto simple y pídele que genere la instrucción estructurada completa. Es excelente en la dirección creativa.
Haz que el Interlocutor1 suene cansado y aburrido, y el Interlocutor2 suene entusiasmado y feliz: Interlocutor1: Entonces... ¿qué hay en la agenda para hoy? Interlocutor2: ¡Nunca lo vas a adivinar! // Combínalo con el emparejamiento de voces para obtener mejores resultados: // Interlocutor1 → Enceladus (susurrante, introspectivo) // Interlocutor2 → Puck (optimista, enérgico)
| Problema | Impacto | Mitigación |
|---|---|---|
| Deriva de la calidad en salidas largas | La calidad del habla se degrada después de unos minutos | Divida las transcripciones en fragmentos de 2-3 minutos. Una el audio en la postproducción. |
| Devoluciones de tokens de texto (errores 500) | Aleatoriamente, ~1-2% de las solicitudes devuelven texto en lugar de audio | Implemente lógica de reintento automático con retroceso exponencial. |
| Desajuste de voz con el prompt | El audio no coincide con el perfil de altavoz seleccionado | Asegúrese de que el preajuste, la voz y el prompt estén semánticamente alineados. |
| Vocalización de etiquetas | Algunas etiquetas se pronuncian como texto literal en lugar de ser interpretadas | Pruebe las nuevas etiquetas en AI Studio antes de su uso en producción. |
| Límites de tarifa | Gemini 2.5 Pro TTS: 100 solicitudes/día en el nivel gratuito | Use Flash para alto volumen, Pro para contenido premium. Implemente colas de solicitudes. |
Prueba todas las etiquetas en AI Studio primero
Antes de comprometerte con un vocabulario de etiquetas, prueba cada una en el entorno de pruebas de Google AI Studio. Verifica que el modelo interpreta correctamente el significado deseado.
Divide el contenido largo en fragmentos
Para contenidos de más de 3 minutos, divide tu transcripción en puntos de ruptura naturales (párrafos, cambios de escena, giros de tema). Genera cada fragmento por separado y luego une los archivos de audio.
Implementa lógica de reintento
Gemini TTS ocasionalmente devuelve tokens de texto en lugar de audio (lo que resulta en un error 500). Esto ocurre en aproximadamente el 1-2% de las solicitudes. Incorpora reintentos automáticos con retroceso exponencial en tu proceso.
Valida la alineación entre voz y ajuste preestablecido
Para cada locutor, verifica que la voz seleccionada coincida de forma natural con la descripción preestablecida. Una voz profunda y autoritaria combinada con un ajuste "joven y juguetón" produce resultados extraños.
Almacena en caché los ajustes preestablecidos para mayor consistencia
Guarda tus ajustes preestablecidos validados como configuración. Nunca redactes instrucciones a mano para cada generación; esto introduce inconsistencias. Usa el mismo archivo de ajuste preestablecido para todo el contenido del mismo locutor.
Supervisa las marcas de agua SynthID
Toda la salida de Gemini TTS lleva una marca de agua SynthID (firma imperceptible para la detección de contenido por IA). Asegúrate de que tu caso de uso cumpla con los requisitos de divulgación para audio generado por IA.
| Modelo | Mejor para | Latencia | Salida máxima | Nivel de precio |
|---|---|---|---|---|
| Gemini 3.1 Flash TTS | Aplicaciones cotidianas, asistentes en tiempo real | Baja | 10 min | $ |
| Gemini 2.5 Flash TTS | Narración de alto volumen, conversacional | Baja | 10 min | $ |
| Gemini 2.5 Pro TTS | Narración de calidad de estudio, audiolibros | Media | 25 min | $$ |
| Gemini 2.5 Flash Lite | Sensible a los costes, alto rendimiento | Muy bajo | 5 min | $ |
- Ajustes preestablecidos → Definen quién, dónde y cómo (reutilizables por locutor)
- Selección de voz → Coincidencia de las características naturales de la voz con tu personaje
- Etiquetas en línea → Control granular por frase (usar con moderación, probar primero)
- Instrucciones de sistema → Establecen el tono general, la escena y el estilo de interpretación
- Medidas de seguridad → Fragmentar contenido largo, reintentar errores, validar alineación
Salta el código: Si deseas estas voces impulsadas por Gemini directamente en tus Google Docs sin escribir integraciones API, prueba el complemento AI Narrator gratuito: maneja toda la canalización de generación de voz por ti.
- Las mejores API de voz IA en 2026: comparación completa de todos los proveedores de API TTS
- Guía de clonación de voz IA: clona cualquier voz con instrucciones paso a paso
- AI Narrator vs ElevenLabs: comparación directa de calidad y precios
- Guía de TTS multilingüe: genera voz en más de 70 idiomas
¿Quieres escuchar estas voces tú mismo?
Pruebe nuestro Narrador AI gratis ahora mismo. No es necesario registrarse.
¿Listo para probar AI Narrator?
Comienza a convertir tus Google Docs en audio profesional hoy. ¡Gratis para siempre!
Agregar al Doc - Es gratis