Nari Labs presser Qwen3-TTS under 50 ms og ned til 2 dollar per million tegn
Holder Qwen3-TTS under 50 millisekunder p95 til første hørbare lyd ved 10 forespørsler i sekundet på ett enkelt NVIDIA H100 SXM-kort.
630 tegn med tale i sekundet, til 4,29 dollar timen for kortet. Det er tallene Nari Labs oppgir for sin egen serveringsimplementasjon av Qwen3-TTS 1.7B CustomVoice, som selskapet nå har lagt ut som åpen kildekode sammen med benchmarken.
Nari Labs kjørte fem implementasjoner i fem minutter hver under Poisson-trafikk, blant dem vLLM-Omni, SGLang-Omni og VoxServe. Rett fra hylla lå de andre motorene mellom 278 og 1 160 millisekunder p95, og vLLM-Omni gikk tom for bufret lyd i samtlige forespørsler. Etter tuning kom VoxServe ned på 49,3 ms ved én forespørsel i sekundet, men falt til 363 ms ved seks. Nari Labs' eget oppsett holder seg under 50 ms helt opp til ti, og under 100 ms ved tjue.
Gevinsten kommer fra planlegging, ikke fra raskere matematikk. Qwen3-TTS består av tre deler: Talker, Code Predictor og Codec. De fleste oppsett slår sammen de to første og kjører Codec for seg, mens Nari Labs eksponerer alle tre som separate oppgaver under én felles planlegger. Da kan en Codec-jobb som nærmer seg avspillingsfristen slippe foran en sammenslått blokk som ikke lar seg avbryte. Code Predictor kjører alltid nøyaktig 15 steg per lydramme, og den faste strukturen lar Nari Labs fange hele løkken som én CUDA-graf.
Hva bør du gjøre?
- Regn på om du faktisk klarer å holde H100-en full. Den prisen forutsetter det, og en halvtom GPU flytter tallet raskt oppover.
- Kjør Nari Labs' åpne benchmark mot din egen tekstmiks før du bytter leverandør.
- Mål p95 og ikke gjennomsnitt: det er halen som gir hørbare hull i avspillingen.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.