Google släppte den 23 september två text-till-tal-modeller, Gemini 3.8 Flash TTS och Gemini 3.8 Flash-Lite TTS, och den siffra som sticker ut är röstbiblioteket: fler än 2 000 produktionsklara röster, mot de 30 som Geminis tidigare talmodeller erbjöd, enligt Unite.AI:s redogörelse. Täckningen omfattar fler än 100 språk och dialekter, inklusive regionala varianter som Google namnger uttryckligen: mexikansk spanska, québécois och skotsk engelska.
Båda modellerna är tillgängliga nu via Gemini-API:et och Google AI Studio.
Två modeller, två uppgifter
Google beskriver Flash TTS som byggd för djup kreativ regi och karaktärsdesign — spel, ljudböcker, poddar — och Flash-Lite TTS som det kostnadseffektiva alternativet för stora volymer, inriktat på dubbning och röstagenter. Google publicerade inga priser för någon av dem i lanseringsinlägget.

Den förmåga som betyder mer än antalet röster är röstdesign. I stället för att välja ur en lista beskriver utvecklaren i vanligt språk den röst hen vill ha — rollen, brytningen, karaktären i framförandet — och modellen genererar den. Google stöder också regi rad för rad, där manusanvisningar styr uppläsningen, inbyggd scenläggning med två talare för samtal, och generering av långt material som enligt bolaget håller över timmar av ljud.
Kloning, samtycke och kartan
Modellerna kan också kopiera en röst utifrån ett 30 sekunder långt ljudprov, något Google villkorar med ett steg för samtyckesverifiering. Utdata bär ett SynthID-vattenmärke.
Den kombinationen är där lanseringen upphör att vara en produktuppdatering. Röstkopiering via AI Studio är inte tillgänglig i Illinois, Texas, EES, Storbritannien, Schweiz och Indien — en lista som läses som en karta över biometrisk lagstiftning och AI-reglering snarare än som en marknadslista. Illinois och Texas har lagar om biometriska identifierare; EES och Storbritannien har dataskyddsregler som behandlar ett röstavtryck som känsligt.

Påståendet om riktmärken
Google uppger att Flash TTS kom först i Hume AI:s Voice Design Benchmark med 71,4 och först i accentmodellering med 60,8. Hume AI är en tredje part, men poängen som de presenteras är Googles citat av dem i det egna lanseringsinlägget, inte en oberoende utvärdering av den här releasen. Unite.AI rapporterar att Flash TTS och Flash-Lite TTS placerade sig etta och tvåa på Humes övergripande kvalitetsindex.
Att hålla ögonen på
Två saker. Om Google publicerar pris per tecken eller per sekund för Flash-Lite, eftersom dubbningens ekonomi helt hänger på det. Och om steget med samtyckesverifiering visar sig starkt nog för att hålla funktionen tillgänglig i de jurisdiktioner som i dag är undantagna — eller om den listan växer.