ElevenLabs v4 Turbo gir stemmeagenter 150 ms til første lyd og kloner stemmer på 10 sekunder
Bytt til eleven_v4_turbo i stemmeagenten din for å få mer uttrykksfull tale med kortere ventetid, og mål forsinkelsen selv før du stoler på ElevenLabs' tall.
150 ms fra forespørsel til hørbar tale. Det er medianen ElevenLabs oppgir for Eleven v4 Turbo, lavlatensvarianten av den nye tekst-til-tale-modellen Eleven v4. Selve inferensen tar rundt 100 ms, ifølge blogginnlegget. Tallene er målt over WebSocket-strømming, og ElevenLabs har trukket nettverkstiden fra.
Begge v4-modellene støtter over 90 språk, mot over 70 for v3, og ElevenLabs' modelldokumentasjon lister norsk bokmål (nob) blant dem. En stemme spilt inn på ett språk kan nå snakke de andre med morsmålsaksent. Instant Voice Clones trenger bare 10 sekunder lyd, og Eleven v4 tar opptil 10 000 tegn per forespørsel, dobbelt så mye som v3.
Lydtaggene fra v3 er utvidet. Du kan skrive instrukser som [laughs] eller [light rain] rett i teksten, og ifølge TechCrunch kan du nå stable flere tagger som modellen følger i rekkefølge. Turbo-varianten kan begynne å generere lyd så snart språkmodellen bak agenten starter å svare.
Kvalitetspåstandene kommer fra ElevenLabs selv: førsteplass på Artificial Analysis' Voice Arena og rundt 75 prosent seier i blindtester mot blant andre Cartesia Sonic 3.6 og Googles Gemini-TTS. Modellene er tilgjengelige i ElevenAgents, ElevenCreative og API-et som eleven_v4 og eleven_v4_turbo.
Hva bør du gjøre?
- Sett
model_idtileleven_v4_turboi en testgren av stemmeagenten og mål tid til første lyd fra din egen region, siden nettverkstiden er trukket fra i ElevenLabs' tall. - Klon en stemme fra 10 sekunder lyd og test den på norsk bokmål med lengre replikker for å høre om aksenten holder seg.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.