Google udsendte den 23. september to tekst-til-tale-modeller, Gemini 3.8 Flash TTS og Gemini 3.8 Flash-Lite TTS, og det tal, der springer i øjnene, er stemmebiblioteket: mere end 2000 produktionsklare stemmer, mod de 30, som Geminis tidligere talemodeller tilbød, ifølge Unite.AI’s gennemgang. Dækningen omfatter mere end 100 sprog og dialekter, herunder regionale varianter, som Google udtrykkeligt nævner: mexicansk spansk, québec-fransk og skotsk engelsk.
Begge modeller er tilgængelige nu via Gemini-API’et og Google AI Studio.
To modeller, to opgaver
Google beskriver Flash TTS som bygget til dyb kreativ instruktion og karakterdesign — spil, lydbøger, podcasts — og Flash-Lite TTS som det omkostningseffektive valg til store mængder, rettet mod dubbing og stemmeagenter. Google offentliggjorde ingen priser for nogen af dem i lanceringsopslaget.

Den evne, der betyder mere end antallet af stemmer, er stemmedesign. I stedet for at vælge fra en liste beskriver udvikleren i almindeligt sprog den stemme, vedkommende vil have — rollen, accenten, karakteren i fremførelsen — og modellen genererer den. Google understøtter også instruktion linje for linje, hvor manuskriptets anvisninger styrer oplæsningen, indbygget iscenesættelse med to talere til samtaler, og generering af langt materiale, som ifølge selskabet holder over timers lyd.
Kloning, samtykke og kortet
Modellerne kan også kopiere en stemme ud fra en 30 sekunders lydprøve, hvilket Google betinger af et trin med samtykkeverifikation. Output bærer et SynthID-vandmærke.
Det er dér, lanceringen holder op med at være en produktopdatering. Stemmekloning via AI Studio er ikke tilgængelig i Illinois, Texas, EØS, Storbritannien, Schweiz og Indien — en liste, der læses som et kort over biometrisk lovgivning og AI-regulering snarere end som en markedsliste. Illinois og Texas har love om biometriske identifikatorer; EØS og Storbritannien har databeskyttelsesregler, der behandler et stemmeaftryk som følsomt.

Påstanden om målinger
Google oplyser, at Flash TTS blev nummer et i Hume AI’s Voice Design Benchmark med 71,4 og nummer et i accentmodellering med 60,8. Hume AI er en tredjepart, men scorerne, som de præsenteres, er Googles citat af dem i selskabets eget lanceringsopslag, ikke en uafhængig evaluering af denne udgivelse. Unite.AI skriver, at Flash TTS og Flash-Lite TTS kom ind som nummer et og to på Humes samlede kvalitetsindeks.
Hvad man skal holde øje med
To ting. Om Google offentliggør pris pr. tegn eller pr. sekund for Flash-Lite, da dubbingøkonomien afhænger helt af det. Og om trinnet med samtykkeverifikation viser sig stærkt nok til at holde funktionen tilgængelig i de jurisdiktioner, der i dag er udeladt — eller om den liste vokser.