Hopp til hovedinnhold
Tilbake
Verktøy 3 min · Kilde: Hugging Face - Blog

Magpie TTS gir første lyd på 32 ms, men støtter ikke norsk

KI Takeaway KI-generert · kan inneholde feil

Slipper NVIDIA en åpen flerspråklig talemodell på 364 millioner parametere som leverer første lyd på 32 millisekunder på en B200.

Et integrert tale-API gir deg ett kall: lyd inn, lyd ut. En kaskade av egne komponenter for gjenkjenning, språkmodell og talesyntese gir deg fire ting til: muligheten til å finjustere hvert ledd for ditt domene, bytte ut en modell når en bedre kommer, holde data innenfor din egen jurisdiksjon, og se nøyaktig hvor millisekundene forsvinner. NVIDIA Magpie TTS Multilingual er bygget for den andre veien, med åpne vekter og en ferdig NIM-container.

Tallet som betyr mest for en samtaleagent er Time to First Audio, tiden fra talegenereringen starter til brukeren hører noe. NVIDIA oppgir 32 millisekunder på en B200 med én strøm, 47 på H100, 53 på DGX Spark og 79 på A100. Målingene er hentet fra NVIDIAs egen ytelsesdokumentasjon for TTS NIM, versjon 26.07, som snitt av tre forsøk kjørt på egne maskiner. Med 32 millisekunder brukt på talesyntesen er det fortsatt rom igjen under de 200 millisekundene naturlig samtale krever, til gjenkjenning og språkmodell.

Nøkkeltall
32 ms
B200, én strøm
47 ms
H100, én strøm
53 ms
DGX Spark, én strøm
79 ms
A100, én strøm

Samtidighet endrer bildet. Ved 64 parallelle strømmer holder B200 seg på 239 millisekunder og leverer 320 ganger sanntid, mens DGX Spark faller til 962 millisekunder. Skrivebordsboksen som ser jevnbyrdig ut med én bruker, er det ikke når agenten din får trafikk.

Modellen dekker tolv språk: engelsk, spansk, fransk, tysk, italiensk, vietnamesisk, mandarin, hindi, japansk, og nå også moderne standardarabisk, koreansk og brasiliansk portugisisk. Norsk er ikke blant dem. Hvert språk har både mannlig og kvinnelig stemme gjennom en delt flerspråklig talerrepresentasjon, og hindi og japansk har utvidet støtte for kodeveksling gjennom IPA-basert grafem-til-fonem og egne uttaleordbøker.

Kvaliteten måles i tegnfeilrate (CER) og talerlikhet (SSIM). Fransk faller fra 2,70 til 1,54 prosent CER og stiger fra 0,703 til 0,747 i SSIM. Spansk går fra 1,14 til 0,60 prosent, med talerlikhet opp fra 0,715 til 0,793. Tysk er ikke entydig: tegnfeilraten går feil vei, fra 0,66 til 0,80 prosent, mens talerlikheten stiger fra 0,626 til 0,742. De tre nye språkene legger en grunnlinje på 1,62 prosent for arabisk, 2,69 for koreansk og 2,91 for brasiliansk portugisisk.

Farten kommer fra to arkitekturgrep. Frame stacking lar dekoderen forutsi to lydrammer per steg i stedet for én, og halverer dermed antall dekoderrunder. Det alene ville senket kvaliteten, fordi kodebok-tokens som genereres samtidig får avhengigheter mellom seg. En lokal transformer modellerer nettopp de avhengighetene og henter kvaliteten tilbake. Metoden er beskrevet i artikkelen «Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation» på ICASSP 2026.

Sjekkpunktet på Hugging Face og NIM-containeren er samme modell. Sjekkpunktet er veien for forskning og finjustering, mens NIM er den optimaliserte serveringsstakken som produserer latenstallene over. Begge kjører på maskinvare du kontrollerer selv. Magpie inngår også i NVIDIAs Nemotron Voice Agent Developer Example, en referanseimplementasjon med gjenkjenning, språkmodell og avbrytbar samtale satt sammen.

Hva bør du gjøre?

  1. Hent sjekkpunktet fra Hugging Face hvis du skal finjustere på eget stemmemateriale, og bruk NIM-containeren hvis du er ute etter latenstallene i produksjon.
  2. Mål Time to First Audio på din egen maskinvare ved den samtidigheten du faktisk forventer. Spranget fra 53 til 962 millisekunder på DGX Spark mellom én og 64 strømmer viser hvor lite en enkeltstrømsmåling forteller.
  3. Planlegg for at norsk mangler. NeMo lar deg finjustere på egne opptak og legge inn egne uttaleordbøker, men trenger du norsk tale i dag, må du beholde en annen motor for det språket.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter