Nvidias Nemotron 3 Diarization skiller åtte talere med 100 millioner parametere
Bytt ut Nvidias Streaming Sortformer med Nemotron 3 Diarization hvis transkripsjonspipelinen din må vite hvem som sa hva i møter med flere enn fire deltakere.
Nvidias forrige streaming-modell for talerseparasjon (diarization) håndterte fire stemmer. Nemotron 3 Diarization, som Nvidia presenterte på Hugging Face-bloggen 23. september, håndterer åtte, og er en modell med åpne vekter på 100 millioner parametere. På VoiceArenas Diarization-Bench, 139 engelske samtaler på rundt 22 timer, fikk den en diarization error rate (DER) på 14,72 prosent mot 19,3 for nummer to, og ble rangert først blant 12 systemer. Nvidia skriver selv at de første resultatene kan endre seg når VoiceArena fullfører evalueringen.
Mot forgjengeren er forskjellen større. Ved 1,04 sekunders buffer reduserer den nye modellen DER på alle de åtte testsettene Nvidia viser, med relative forbedringer fra 9,0 prosent på CALLHOME-Part2 til 65,2 prosent på NOTSOFAR1, i snitt 41 prosent. Ett unntak gjelder enkle oppsett: på CALLHOME-delsettet med bare to talere scorer den nye modellen 5,98 prosent mot 5,68 for forgjengeren.
Teknisk tar modellen inn lyd i 16 kHz mono og gir ut sannsynligheten for at hver av åtte talerkanaler er aktiv, hvert tiende millisekund. Talerne nummereres i den rekkefølgen de først dukker opp, så etikettene holder seg stabile mellom lydbitene i streaming. Etikettene er anonyme: modellen sier at speaker_2 snakket, ikke hvem speaker_2 er. Samme modell kan kjøres med buffer på 30,4, 1,04, 0,64 eller 0,32 sekunder, der kortere buffer gir raskere svar og noe lavere presisjon.
Gjennomstrømningen er høy, men Nvidia advarer selv mot å lese den som latens:
«Disse resultatene måler batchet gjennomstrømning på det oppgitte testsystemet. De skal ikke tolkes som latens for én strøm fra ende til ende.» — Nvidia
Med batch 32 på et RTX PRO 5000 og buffer på 30,4 sekunder behandler modellen lyd 15 113 ganger raskere enn sanntid, mot 2 619 for forgjengeren. Treningsdataene inkluderer simulerte samtaleblandinger på 21 språk, men Nvidia lister ikke hvilke, og benchmarkene over er engelske.
Hva bør du gjøre?
- Installer med
uv pip install 'nemo-toolkit[asr]'og last modellen medSortformerEncLabelModel.from_pretrained("nvidia/Nemotron-3-Diarization"). Den er laget for Linux med Nvidia-GPU av typen Ampere, Hopper eller Blackwell. - Start med oppsettet på 30,4 sekunder for innspilte opptak, og gå ned mot 0,32 sekunder bare hvis du trenger live-svar.
- Test på egne norske opptak før du bytter, særlig hvis de fleste samtalene dine bare har to deltakere.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.