A Google publicou a 23 de setembro dois modelos de texto para fala, o Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS, e o número em destaque é a biblioteca de vozes: mais de 2000 vozes prontas para produção, contra as 30 que os anteriores modelos de voz do Gemini ofereciam, segundo o relato da Unite.AI. A cobertura ultrapassa os 100 idiomas e dialetos, incluindo variedades regionais que a Google nomeia expressamente: espanhol do México, francês do Quebeque, inglês da Escócia.

Ambos os modelos estão disponíveis já através da API Gemini e do Google AI Studio.

Dois modelos, dois trabalhos

A Google descreve o Flash TTS como feito para direção criativa aprofundada e criação de personagens — jogos, audiolivros, podcasts — e o Flash-Lite TTS como a opção económica para grandes volumes, dirigida à dobragem e a agentes de voz. A Google não publicou preços para nenhum deles no anúncio.

Um engenheiro de som a trabalhar numa mesa de mistura com faders e indicadores
O Flash TTS aceita direção linha a linha a partir das indicações do guião. Fotografia ilustrativa. Los Muertos Crew · pexels · Pexels License

A capacidade que importa mais do que o número de vozes é o desenho de voz. Em vez de escolher de uma lista, quem desenvolve descreve em linguagem corrente a voz que quer — o papel, o sotaque, o carácter da interpretação — e o modelo gera-a. A Google suporta ainda direção linha a linha, em que as indicações do guião orientam a leitura, encenação nativa a duas vozes para diálogos, e geração de formato longo que, diz a empresa, se aguenta ao longo de horas de áudio.

Clonagem, consentimento e o mapa

Os modelos também replicam uma voz a partir de uma amostra de 30 segundos, algo que a Google condiciona a um passo de verificação de consentimento. A saída leva uma marca de água SynthID.

É aí que o lançamento deixa de ser uma atualização de produto. A clonagem de voz através do AI Studio não está disponível no Illinois, no Texas, no Espaço Económico Europeu, no Reino Unido, na Suíça e na Índia — uma lista que se lê como um mapa da legislação biométrica e de IA e não como uma lista de mercados. O Illinois e o Texas têm leis sobre identificadores biométricos; o EEE e o Reino Unido têm regimes de proteção de dados que tratam a impressão vocal como dado sensível.

Uma pessoa com auscultadores a editar uma forma de onda de áudio num portátil
Toda a saída leva uma marca de água SynthID. Fotografia ilustrativa. https://kaboompics.com/ · pexels · Pexels License

A alegação sobre os testes

A Google afirma que o Flash TTS ficou em primeiro no Voice Design Benchmark da Hume AI com 71,4 e em primeiro em modelação de sotaque com 60,8. A Hume AI é um terceiro, mas as pontuações tal como são apresentadas são a citação que a Google faz delas no seu próprio anúncio, e não uma avaliação independente deste lançamento. A Unite.AI noticia que o Flash TTS e o Flash-Lite TTS ficaram em primeiro e segundo no índice geral de qualidade da Hume.

O que observar

Duas coisas. Se a Google publica preços por caráter ou por segundo para o Flash-Lite, porque a economia da dobragem depende inteiramente disso. E se o passo de verificação de consentimento se revela suficientemente sólido para manter a funcionalidade nas jurisdições hoje excluídas — ou se essa lista de exclusões cresce.