Felfedte a HumeAI, hogy a beszédfelismerő AI-k a tesztekre optimalizálódnak, nem a feladatra
A HumeAI a Real World VoiceEQ, az Open-ASR Leaderboard és a Far-field ASR Leaderboard mutatóit vezette be, hogy a valós használati szempontokat is mérjék. A cég szerint a hagyományos tesztek figyelmen kívül hagyják a megbízhatóságot és a természetességet.

A kutatók 11 elterjedt, nyílt forráskódú ASR-modellt értékeltek. Megállapították, hogy a legmagasabb pontszámot elért rendszerek közül több reprodukálta a VoxPopuli English és a LibriSpeech (clean, other) adathalmazok teljesítményteszt-átiratait — még akkor is, ha a hanganyag ellentmondott nekik, releváns szavakat elnémítottak, vagy a hanganyag egyaránt támogatta két különböző írott formát. (Hugging Face)
Referencia-eltérés vizsgálata
A VoxPopuli közismerten sok átírási hibát tartalmaz. A HumeAI konszenzusos eltérés-vizsgálata azt teszteli, mi történik, amikor a vezető ASR-modellek belefutnak ezekbe a hibákba: pontosan átírják-e, amit a hanganyag mond, vagy reprodukálják a teljesítményteszt hibás referenciáját?
Független modellek együttesét használják, amelyeket alacsony fonémahiba-aránnyal (PER) választottak ki. A PER méri, hogy egy írott átirat mennyire felel meg a hanganyagban elhangzottaknak. Az együttes eredmények felhasználhatók azoknak az eseteknek a megjelölésére, amelyekben a modellek egyöntetűen eltérnek a teljesítményteszt referenciájától.
Például egy VoxPopuli klip hanganyaga tartalmazza a „Thank you, Mr. President” kifejezést, de a referenciában ez hiányzik. A tesztelt 11 modellből hat reprodukálta a teljesítményteszt hibás átiratát — megadva a „várt” választ, annak ellenére, hogy az ellentmondott a hanganyagnak. A valós klipen a formázás ugyanazt a mintát követi: azok a modellek, amelyek kihagyják a „Thank you”-t, reprodukálják a teljesítményteszt írásstílusát is, pont nélkül írva „Mr”-t, míg azok, amelyek a hangzó kifejezést tartalmazzák, általában ponttal írják „Mr.”-t.
A fenti mintákban minden modell (egy kivételével) visszaáll a hanghű átiratra egy új parlamenti felvétel klónjához. A metodológia potenciális referenciahibákat jelzett a vizsgált VoxPopuli tesztklip-ek 40%-ában, ami az összes referencia-szó körülbelül 3%-át érintette. A teljesítményteszt-optimalizált viselkedést mutató modellek 18–30%-ban reprodukálták a hibás referencia-átiratokat.
Maszkolt entitás-visszakeresés
A konszenzusos eltérés-vizsgálat továbbépítéseként szándékosan elnémítják a számokat a tesztadatkészletek hangmintáiban, és arra kérik a modelleket, hogy írják át, amit hallanak. A szám szó szerint hiányzik a hanganyagból, így a modelleknek nem szabad számot kiadniuk, pláne nem a szövegben szereplő pontos számot.
A következő ábra összehasonlítja a VoxPopuli szóhiba-arányát (WER) a x-tengelyen azzal a rátával, amellyel az egyes modellek reprodukálják a teljesítményteszt hibás referenciáját a konszenzusos korrekció helyett. A legalacsonyabb WER-rel rendelkező modellek — és így a legerősebb jelentett teljesítményteszt-teljesítménnyel — a legvalószínűbbek, hogy reprodukálják ezeket a hibákat.