Google slapp 23. september to tekst-til-tale-modeller, Gemini 3.8 Flash TTS og Gemini 3.8 Flash-Lite TTS, og tallet som stikker seg ut er stemmebiblioteket: mer enn 2000 produksjonsklare stemmer, mot de 30 som Geminis forrige talemodeller tilbød, ifølge Unite.AI sin gjennomgang. Dekningen omfatter mer enn 100 språk og dialekter, inkludert regionale varianter Google nevner eksplisitt: meksikansk spansk, québec-fransk og skotsk engelsk.

Begge modellene er tilgjengelige nå gjennom Gemini-API-et og Google AI Studio.

To modeller, to oppgaver

Google beskriver Flash TTS som bygget for dyp kreativ regi og karakterdesign — spill, lydbøker, podkaster — og Flash-Lite TTS som det kostnadseffektive alternativet for store volumer, rettet mot dubbing og stemmeagenter. Google publiserte ingen priser for noen av dem i lanseringsinnlegget.

En lydtekniker arbeider ved et mikserbord med fadere og målere
Flash TTS tar imot regi linje for linje fra manusanvisninger. Illustrasjonsfoto. Los Muertos Crew · pexels · Pexels License

Evnen som betyr mer enn antall stemmer, er stemmedesign. I stedet for å velge fra en liste beskriver utvikleren på vanlig språk stemmen hen vil ha — rollen, aksenten, karakteren i framføringen — og modellen genererer den. Google støtter også regi linje for linje, der manusanvisninger styrer opplesningen, innebygd scenesetting med to talere for samtaler, og generering av langt materiale som ifølge selskapet holder over timer med lyd.

Kloning, samtykke og kartet

Modellene kan også kopiere en stemme fra en 30 sekunders lydprøve, noe Google betinger med et trinn for samtykkeverifisering. Utdata bærer et SynthID-vannmerke.

Det er der lanseringen slutter å være en produktoppdatering. Stemmekloning via AI Studio er ikke tilgjengelig i Illinois, Texas, EØS, Storbritannia, Sveits og India — en liste som leses som et kart over biometrisk lovgivning og KI-regulering snarere enn som en markedsliste. Illinois og Texas har lover om biometriske identifikatorer; EØS og Storbritannia har personvernregelverk som behandler et stemmeavtrykk som sensitivt.

En person med hodetelefoner redigerer en lydbølgeform på en bærbar datamaskin
All utdata bærer et SynthID-vannmerke. Illustrasjonsfoto. https://kaboompics.com/ · pexels · Pexels License

Påstanden om målinger

Google oppgir at Flash TTS kom først i Hume AI sin Voice Design Benchmark med 71,4 og først i aksentmodellering med 60,8. Hume AI er en tredjepart, men poengene slik de presenteres er Googles sitering av dem i sitt eget lanseringsinnlegg, ikke en uavhengig evaluering av denne utgivelsen. Unite.AI melder at Flash TTS og Flash-Lite TTS kom på første og andre plass på Humes samlede kvalitetsindeks.

Hva man skal følge med på

To ting. Om Google publiserer pris per tegn eller per sekund for Flash-Lite, siden dubbingøkonomien avhenger helt av det. Og om trinnet med samtykkeverifisering viser seg sterkt nok til å holde funksjonen tilgjengelig i jurisdiksjonene som nå er utelatt — eller om den listen vokser.