VoiceChat 11B erstatter tre modeller med én, men lisensen stopper på forskning
Slipper NVIDIA modellen VoiceChat 11B, som gjør talegjenkjenning og talegenerering i én arkitektur og svarer etter rundt 450 millisekunder.
Vanlige stemmeagenter er tre modeller i kjede: tale til tekst, så en språkmodell, så tekst til tale. Hvert ledd legger på ventetid og enda et sted der ting kan gå galt. NVIDIA NemotronLabs VoiceChat 11B gjør alt i én modell. Lyd kodes av en Fast Conformer-encoder, tokenene går inn i en Nemotron Nano v2-språkmodell, og en TTS-dekoder produserer svaret. NVIDIA oppgir rundt 450 millisekunder for turtaking, og modellen kan avbrytes midt i et svar.
Det NVIDIA fremhever som førstegangen er verktøykall. Selskapet beskriver VoiceChat som den første åpne full duplex-modellen som kaller verktøy uten å bryte samtaleflyten. Løsningen er konkret: verktøykallene kommer ut på en egen utgangskanal, og for hvert verktøy kan du definere en «vent litt»-replikk som agenten sier høyt idet modellen begynner å generere kallet. Pausen fylles med tale i stedet for stillhet.
Så kommer forbeholdene. Modellen ble utgitt 3. august under OpenMDW-lisensen versjon 1.1, og modellkortet slår fast at den er klar for forskningsformål alene. Kjøremiljøet er vLLM, og maskinvarelista er A100, H100, H200, B100, B200 og RTX 6000. Dette er ikke en modell du legger på en bærbar. Treningsgrunnlaget oppgis til rundt 550 000 timer lyd, og på VoiceBench rangerer NVIDIA den selv som nummer to blant åpne full duplex-modeller.
Hva bør du gjøre?
- Kjør sjekkpunktet fra Hugging Face offline først hvis du bare vil måle kvaliteten på tale til tale, uten å sette opp streaming.
- Bruk NVIDIAs inferanse-container med WebSocket når du faktisk skal teste avbrytelser og turtaking, siden det er der latenstallet gjelder.
- Avklar lisensen før du bygger noe som skal selges. Forskningsformål er ikke det samme som produksjon.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.