Google publicó el 23 de septiembre dos modelos de texto a voz, Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, y la cifra destacada es la biblioteca de voces: más de 2.000 voces listas para producción, frente a las 30 que ofrecían los modelos de voz anteriores de Gemini, según el relato de Unite.AI. La cobertura alcanza más de 100 idiomas y dialectos, incluidas variedades regionales que Google nombra expresamente: español de México, francés de Quebec, inglés de Escocia.

Ambos modelos están disponibles ya a través de la API de Gemini y de Google AI Studio.

Dos modelos, dos trabajos

Google describe Flash TTS como pensado para la dirección creativa y el diseño de personajes —videojuegos, audiolibros, pódcast— y Flash-Lite TTS como la opción de alto volumen y bajo coste, orientada al doblaje y a los agentes de voz. Google no publicó precios de ninguno de los dos en el anuncio.

Un ingeniero de sonido trabajando en una mesa de mezclas con faders e indicadores
Flash TTS acepta dirección línea a línea desde las acotaciones del guion. Fotografía ilustrativa. Los Muertos Crew · pexels · Pexels License

La capacidad que importa más que el número de voces es el diseño de voz. En lugar de elegir de una lista, quien desarrolla describe en lenguaje corriente la voz que quiere —el papel, el acento, el carácter de la interpretación— y el modelo la genera. Google admite además dirección línea a línea, en la que las acotaciones del guion orientan la lectura, puesta en escena nativa a dos voces para conversaciones y generación de formato largo que, según la compañía, se sostiene a lo largo de horas de audio.

Clonación, consentimiento y el mapa

Los modelos también replican una voz a partir de una muestra de 30 segundos, algo que Google condiciona a un paso de verificación de consentimiento. La salida lleva una marca de agua SynthID.

Esa combinación es donde el lanzamiento deja de ser una actualización de producto. La replicación de voz mediante AI Studio no está disponible en Illinois, Texas, el Espacio Económico Europeo, el Reino Unido, Suiza ni la India: una lista que se lee como un mapa de la legislación biométrica y de IA más que como una lista de mercados. Illinois y Texas tienen leyes sobre identificadores biométricos; el EEE y el Reino Unido cuentan con regímenes de protección de datos que tratan la huella vocal como dato sensible.

Una persona con auriculares editando una onda de audio en un portátil
Toda salida lleva una marca de agua SynthID. Fotografía ilustrativa. https://kaboompics.com/ · pexels · Pexels License

La afirmación sobre los benchmarks

Google informa de que Flash TTS quedó primero en el Voice Design Benchmark de Hume AI con 71,4 y primero en modelado de acentos con 60,8. Hume AI es un tercero, pero las puntuaciones tal como se presentan son la cita que hace Google de ellas en su propio anuncio, no una evaluación independiente de este lanzamiento. Unite.AI informa de que Flash TTS y Flash-Lite TTS quedaron primero y segundo en el índice general de calidad de Hume.

Qué vigilar

Dos cosas. Si Google publica precios por carácter o por segundo para Flash-Lite, porque la economía del doblaje depende enteramente de eso. Y si el paso de verificación de consentimiento resulta lo bastante sólido como para mantener la función disponible en las jurisdicciones hoy excluidas, o si esa lista de exclusiones crece.