Google a publié le 23 septembre deux modèles de synthèse vocale, Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, et le chiffre mis en avant est la bibliothèque de voix : plus de 2 000 voix prêtes pour la production, contre les 30 que proposaient les précédents modèles vocaux de Gemini, selon le récit d’Unite.AI. La couverture dépasse 100 langues et dialectes, y compris des variétés régionales que Google nomme expressément : espagnol du Mexique, français du Québec, anglais d’Écosse.
Les deux modèles sont disponibles dès maintenant via l’API Gemini et Google AI Studio.
Deux modèles, deux usages
Google présente Flash TTS comme conçu pour la direction artistique poussée et la création de personnages — jeux, livres audio, podcasts — et Flash-Lite TTS comme l’option économique pour les gros volumes, destinée au doublage et aux agents vocaux. Aucun tarif n’a été publié pour l’un ou l’autre dans l’annonce.

La capacité qui compte plus que le nombre de voix est la conception de voix. Au lieu de choisir dans une liste, le développeur décrit en langage courant la voix qu’il veut — le rôle, l’accent, le caractère de l’interprétation — et le modèle la génère. Google prend aussi en charge une direction ligne par ligne, où les indications de script orientent la lecture, une mise en scène native à deux voix pour les dialogues, et une génération longue qui, selon l’entreprise, tient sur des heures d’audio.
Clonage, consentement et la carte
Les modèles reproduisent également une voix à partir d’un échantillon de 30 secondes, ce que Google conditionne à une étape de vérification du consentement. La sortie porte un filigrane SynthID.
C’est là que la publication cesse d’être une simple mise à jour produit. Le clonage vocal via AI Studio n’est pas disponible en Illinois, au Texas, dans l’Espace économique européen, au Royaume-Uni, en Suisse et en Inde — une liste qui se lit comme une carte du droit biométrique et du droit de l’IA plutôt que comme une liste de marchés. L’Illinois et le Texas disposent de lois sur les identifiants biométriques ; l’EEE et le Royaume-Uni ont des régimes de protection des données qui traitent l’empreinte vocale comme une donnée sensible.

L’argument des classements
Google indique que Flash TTS s’est classé premier au Voice Design Benchmark de Hume AI avec 71,4, et premier en modélisation d’accent avec 60,8. Hume AI est un tiers, mais les scores tels qu’ils sont présentés sont la citation qu’en fait Google dans son propre billet, et non une évaluation indépendante de cette version. Unite.AI rapporte que Flash TTS et Flash-Lite TTS se sont classés premier et deuxième à l’indice de qualité global de Hume.
Ce qu’il faut surveiller
Deux choses. Google publiera-t-il un tarif au caractère ou à la seconde pour Flash-Lite, car l’économie du doublage en dépend entièrement. Et l’étape de vérification du consentement se révélera-t-elle assez solide pour maintenir la fonction dans les juridictions aujourd’hui exclues — ou cette liste d’exclusions va-t-elle s’allonger.