Seks av elleve ASR-modeller gjenga fasitens feil, ikke lyden
Gjengir flere høyt rangerte ASR-modeller benchmarkens fasittekst i stedet for det lyden faktisk sier, viser ny testing fra Hugging Face.
Talegjenkjenning har lenge manglet en måte å måle benchmark-optimalisering på, det som ellers kalles benchmaxxing. Hugging Face har allerede lagt inn holdt-tilbake-sett i Real World VoiceEQ, Open-ASR Leaderboard og Far-field ASR Leaderboard, men bredere måling løser ikke problemet alene. Den nye forskningen legger til tre prøver som tallfester det.
Hugging Face kjørte 11 mye brukte åpne ASR-modeller mot VoxPopuli English og LibriSpeech, og sjekket hva modellene gjør når fasiten og lyden er uenige:
- Lyden motsier fasitteksten direkte
- Ord som står i fasiten er fjernet fra lydsporet
- Lyden støtter to ulike skriftlige former like godt
VoxPopuli er kjent for å inneholde transkripsjonsfeil, og Artificial Analysis har gitt ut en renset versjon. I ett klipp sier lyden hørbart «Thank you, Mr. President», mens fasiten utelater «Thank you». Seks av de 11 modellene gjenga fasitens feil. Mønsteret gikk lenger enn ordene: modellene som droppet høflighetsfrasen, skrev også «Mr» uten punktum, akkurat slik benchmarken formaterer det.
Testen som avgjør tolkningen er stemmekloningen. Da den samme setningen ble spilt inn med en stemme fra et parlamentsopptak gjort etter treningskuttet til samtlige modeller, snudde alle unntatt én og transkriberte det lyden faktisk sa. Modellene later altså til å kjenne igjen akustiske spor som røper hvilken benchmark de blir testet på, og svarer med det forventede svaret.
For deg som velger ASR-modell etter ledertavlene, betyr det at avstanden mellom to toppmodeller kan være et måleartefakt snarere enn en reell forskjell i hvor godt de hører. Rangeringer basert på VoxPopuli og LibriSpeech alene sier lite om hvordan en modell takler lyd den ikke har sett før.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.