Google publicó el 23 de septiembre dos modelos de texto a voz, Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, y la cifra destacada es la biblioteca de voces: más de 2.000 voces listas para producción, frente a las 30 que ofrecían los modelos de voz anteriores de Gemini, según el relato de Unite.AI. La cobertura alcanza más de 100 idiomas y dialectos, incluidas variedades regionales que Google nombra expresamente: español de México, francés de Quebec, inglés de Escocia.
Ambos modelos están disponibles ya a través de la API de Gemini y de Google AI Studio.
Dos modelos, dos trabajos
Google describe Flash TTS como pensado para la dirección creativa y el diseño de personajes —videojuegos, audiolibros, pódcast— y Flash-Lite TTS como la opción de alto volumen y bajo coste, orientada al doblaje y a los agentes de voz. Google no publicó precios de ninguno de los dos en el anuncio.

La capacidad que importa más que el número de voces es el diseño de voz. En lugar de elegir de una lista, quien desarrolla describe en lenguaje corriente la voz que quiere —el papel, el acento, el carácter de la interpretación— y el modelo la genera. Google admite además dirección línea a línea, en la que las acotaciones del guion orientan la lectura, puesta en escena nativa a dos voces para conversaciones y generación de formato largo que, según la compañía, se sostiene a lo largo de horas de audio.
Clonación, consentimiento y el mapa
Los modelos también replican una voz a partir de una muestra de 30 segundos, algo que Google condiciona a un paso de verificación de consentimiento. La salida lleva una marca de agua SynthID.
Esa combinación es donde el lanzamiento deja de ser una actualización de producto. La replicación de voz mediante AI Studio no está disponible en Illinois, Texas, el Espacio Económico Europeo, el Reino Unido, Suiza ni la India: una lista que se lee como un mapa de la legislación biométrica y de IA más que como una lista de mercados. Illinois y Texas tienen leyes sobre identificadores biométricos; el EEE y el Reino Unido cuentan con regímenes de protección de datos que tratan la huella vocal como dato sensible.

La afirmación sobre los benchmarks
Google informa de que Flash TTS quedó primero en el Voice Design Benchmark de Hume AI con 71,4 y primero en modelado de acentos con 60,8. Hume AI es un tercero, pero las puntuaciones tal como se presentan son la cita que hace Google de ellas en su propio anuncio, no una evaluación independiente de este lanzamiento. Unite.AI informa de que Flash TTS y Flash-Lite TTS quedaron primero y segundo en el índice general de calidad de Hume.
Qué vigilar
Dos cosas. Si Google publica precios por carácter o por segundo para Flash-Lite, porque la economía del doblaje depende enteramente de eso. Y si el paso de verificación de consentimiento resulta lo bastante sólido como para mantener la función disponible en las jurisdicciones hoy excluidas, o si esa lista de exclusiones crece.