Audio8 ASR Infinite strømmer kinesisk og engelsk tale til tekst uten lengdegrense
Test Audio8 ASR Infinite hvis du trenger sanntidstranskripsjon av kinesisk eller engelsk på egen GPU, men ikke av norsk.
På kinesisk tale bommer Audio8 ASR Infinite på 1,75 prosent av tegnene i testsettet AISHELL-1, mot 16,8 prosent for Voxtral Mini 4B Realtime. På engelsk snur bildet: i LibriSpeech test-clean har Voxtral 2,2 prosent ordfeil, mot 3,0 prosent for Audio8. Tallene står i modellkortet Edge0 la ut på Hugging Face 21. september, og de er utviklernes egne målinger med 480 ms forsinkelse.
Modellen strømmer innebygd og tar 12,5 avgjørelser i sekundet med 80 ms lydklokke, eller 8,3 og 6,25 med 120 og 160 ms. Sjekkpunktet har bare 30 sekunders kontekst, men et rullerende KV-vindu på 30 sekunder med re-basing av RoPE holder minne og forsinkelse konstant. Med Edge0s tilpassede vLLM-bygg transkriberer den derfor uten stopp døgnet rundt. Lydtårnet er initialisert fra Voxtral Realtime 4B og dekoderen fra Qwen2.5-3B-Instruct, og vektfilen er på 8,17 GB i bfloat16.
«Skiller tenkepauser, stamming og ekte turslutt, der tradisjonell akustisk VAD vanligvis svikter» — Edge0, modellkortet på Hugging Face
Den semantiske VAD-en er det mest interessante for deg som bygger taleagenter. Den ligger som egne hoder med 8 klasser og horisonter fra 0,5 til 3 sekunder, så agenten kan vente når brukeren tenker, i stedet for å avbryte ved første pause. Begrensningen er språket: modellen kan bare kinesisk og engelsk, så norske møter og podkaster faller utenfor. Dette er dessuten en forhåndsversjon, og Edge0 jobber med en full utgivelse med semantisk persepsjon på rammenivå. Modellen er lastet ned 7 859 ganger siste måned.
Hva bør du gjøre?
- Start Docker compose-stakken med
AUDIO8_MODEL_DIRpekt på sjekkpunktet, og test mikrofonen i nettklienten pålocalhost:8080før du skriver egen kode. - Les
modeling_audio8_asr_infinite.pyfør du laster modellen, siden Transformers-eksemplet krevertrust_remote_code=Trueog dermed kjører koden fra repoet. - Mål ordfeil på dine egne engelske opptak mot modellen du bruker i dag, fordi LibriSpeech-tallene favoriserer Voxtral.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.