Gemini 3.8 TTS snakker bokmål og nynorsk og kloner stemmer fra 30 sekunder lyd
Prøv Googles nye Gemini 3.8-talemodeller på norsk, siden de har over 2000 stemmer, kan styres replikk for replikk og kostet Simon Willison 2,74 cent for 78 sekunder lyd.
Google gikk 23. september fra 30 ferdige stemmer til et bibliotek på over 2000 da selskapet lanserte Gemini 3.8 Flash TTS og Gemini 3.8 Flash-Lite TTS. Ifølge Googles blogg kan du også designe nye stemmer med en tekstbeskrivelse, eller gjenskape en stemme fra 30 sekunder lyd. Kloning krever at eieren av stemmen spiller inn et muntlig samtykke som matcher referanseopptaket, og all lyd fra Gemini Audio-modellene merkes med SynthID-vannmerke.
For norske byggere står språklista i Gemini API-dokumentasjonen: Flash TTS støtter 130 språk og Flash-Lite 101, og både bokmål og nynorsk er med på begge. Flash er ment for kreativt arbeid, dialog med flere talere og lange opplesninger. Flash-Lite er laget for høyt volum, dubbing og stemmeagenter. Google oppgir at Flash TTS tok førsteplassen på Hume AIs Voice Design Benchmark med 71,4 poeng, et tall fra leverandøren selv.
Simon Willison bygde samme dag en lekeplass der du bruker din egen API-nøkkel. Den kaller Gemini API direkte fra nettleseren, fordi API-et har åpen CORS-policy. Han peker på at API-et gjør det enkelt å skrive en hel samtale mellom flere karakterer, hver med egen stemme og egne stilinstrukser.
«Det tok rundt 20 sekunder å generere 1 minutt og 18 sekunder lyd med Gemini 3.8 Flash TTS (ikke den billigere Flash-Lite), til en pris av 2,74 cent.» — Simon Willison, utvikler og blogger
Google nevner Agora, LiveKit, Pipecat og Vercel som plattformer som allerede bygger på API-et. Bygger du en stemmeagent eller et lydbokverktøy, får du altså norsk tale med styrbar tone, pauser og latter uten å drifte en egen TTS-modell. Åpen CORS gjør at en ren frontend kan snakke med API-et, men da ligger nøkkelen i nettleseren, så gi den en egen kvote.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.