Qwen Audio 3.1 kutter prisen på talegjenkjenning med opptil 95 prosent
Regn på nytt på talelaget i stemmeagenten din, for Alibabas Qwen-team kutter prisen på talegjenkjenning med opptil 95 prosent i den nye Qwen-Audio-3.1-serien.
En stemmeagent trenger tre ting: talegjenkjenning inn, talesyntese ut og helst en sanntidsmodell som tåler at brukeren avbryter. Qwen-teamet i Alibaba har sluppet Qwen-Audio-3.1, fem modeller som dekker alle tre, og ifølge The Decoder faller prisene samtidig: rundt 70 prosent for talesyntese (TTS), rundt 85 prosent for sanntidsmodellen og opptil 95 prosent for talegjenkjenning (ASR). På Qwen Cloud koster ASR-modellene 0,15 dollar inn og 0,47 dollar ut per million tokens, med en grense på 600 forespørsler i minuttet.
ASR-modellen rydder bort fyllord og gjentakelser automatisk. ASR-Next legger til identifisering av flere talere med tidsstempler, og gjenkjenner følelser, bakgrunnslyd og maskinstøy. Varianten for filtranskripsjon er ifølge Qwen Cloud laget for møtereferater, innholdsproduksjon og samtaleanalyse, med støtte for hot words, taleseparasjon og tegnsetting.
«Den holder stabil ytelse selv i komplekse støyende miljøer, noe som gjør den til førstevalget for transkripsjon av lange lydopptak» — Qwen Cloud, modellsiden for Qwen-Audio-3.1-ASR-Flash-Filetrans
På utgangssiden styres TTS med vanlige tekstinstrukser om følelse, tempo og stil, mens TTS-Next kombinerer en språkmodell med en diffusjonsmetode og lager stemme, lydeffekter og bakgrunnslyd i én omgang. Sanntidsmodellen kan snakke og lytte samtidig og stoppe straks du avbryter.
Den tekniske rapporten for TTS-modellen gir flere detaljer. En talekoder på 12,5 Hz holder latensen nede, én omgang kan gi opptil 3 minutter lyd, og 86 nye tagger styrer ting som latter, pust, hosting og sukk på ord- og frasenivå. Utdata kan skaleres opp til 48 kHz. Rapporten sammenligner med CosyVoice 3.0-0.5B og CosyVoice 3.0-1.5B, og Qwen oppgir at modellen er rangert først på Artificial Analysis sin liste over talesyntese.
«Modellen støtter 16 språk, sju av dem nye, og 20 kinesiske dialektregioner» — Qwen, teknisk rapport for Qwen-Audio-3.1-TTS
For norske byggere er språklista det viktigste forbeholdet, og den gjelder talesyntesen. Eksempeltabellene i TTS-rapporten viser de 16 språkene med språkkoder: ZH, EN, JA, KO, DE, ES, FR, IT og RU, pluss de sju nye AR, ID, PT, TH, VI, MS og TL. Det tilsvarer kinesisk, engelsk, japansk, koreansk, tysk, spansk, fransk, italiensk, russisk, arabisk, indonesisk, portugisisk, thai, vietnamesisk, malayisk og tagalog. Norsk, svensk og dansk står ikke der.
For talegjenkjenningen oppgir verken The Decoder eller Qwen Cloud noen språkliste, bare at modellene er flerspråklige og kjenner igjen kinesiske dialekter. Om ASR-modellen forstår norsk, får du bare vite ved å teste. Modellene ligger i Qwen Cloud, og verken The Decoder eller Qwen Cloud-sidene nevner åpne vekter.
Hva bør du gjøre?
- Kjør noen av dine egne norske opptak gjennom Qwen-Audio-3.1-ASR-Flash via Qwen Cloud-API-et før du bytter, siden ingen av kildene sier noe om norsk.
- Regn ut hva transkripsjonen din koster med 0,15 dollar inn og 0,47 dollar ut per million tokens, og sjekk om grensen på 600 forespørsler i minuttet holder for trafikken din.
- Behold talesyntesen for norsk på en annen modell inntil videre, men test Qwen-Audio-3.1-TTS hvis agenten din også svarer på engelsk eller tysk.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.