Hugging Face rangerer åpne talemodeller på timer i stedet for uker
Velg åpen talemodell etter målt feilrate, forsinkelse og stemmelikhet med Hugging Faces nye Open TTS Leaderboard, i stedet for å vente på arena-stemmer.
«Ved å bruke objektive målinger går evalueringen av en modell fra et par uker (for å samle stemmer) til et par timer», skriver Hugging Face i lanseringen av Open TTS Leaderboard 30. september. Ledertavla måler åpne tekst-til-tale-modeller på tre akser: forståelighet som feilrate (WER/CER) mellom prompten og en transkripsjon av lyden laget med Qwen3 ASR, hastighet som RTFx og time-to-first-audio (TTFA) på en H200 og på CPU, og stemmelikhet som cosinuslikhet mellom WavLM-embeddinger av generert lyd og referanseklippet.
Behovet er tydelig. Hugging Face Hub har over 8000 TTS-modeller, men bare 16 av 92 modeller hos Artificial Analysis har åpne vekter. Hugging Face peker på at en API-modell kan legges inn i en arena med en API-nøkkel, mens en åpen modell må hostes av arena-operatøren selv.
På engelsk topper hexgrad/Kokoro-82M, Supertone/supertonic-3 og fishaudio/s2-pro på snitt-WER over Seed TTS Eval og CV3 Eval. Flerspråklig trekker Hugging Face fram k2-fsa/OmniVoice, fishaudio/s2-pro og FunAudioLLM/Fun-CosyVoice3-0.5B-2512. Streaming-fanen rangerer på median TTFA over 50 engelske prompter med batch size 1, og kyutai/pocket-tts fremheves som sterk på både GPU og CPU.
Begrensningene står i bloggposten selv. WER er en stedfortreder for forståelighet og måler verken naturlighet, uttrykk eller hva lytteren foretrekker. Seed TTS Eval har bare engelsk og kinesisk lyd, så andre språk scores kun på CV3 Eval, og CPU-tallene dekker foreløpig et lite utvalg modeller. Evalueringsskriptene skal etter planen åpnes på GitHub, slik Open ASR Leaderboard allerede er.
Hva bør du gjøre?
- Slå på språkene du trenger og filteret for stemmekloning, og sammenlign SIM-kolonnen hvis appen skal bruke en egen stemme.
- Sjekk Streaming-fanen og CPU-resultatene hvis du bygger stemmeagent uten GPU, der TTFA er tallet som avgjør om samtalen føles treg.
- Lytt til utdataene i Listen-fanen før du bestemmer deg, siden lav feilrate ikke sier noe om hvor naturlig stemmen høres ut.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.