Szaúdi arab dialektusokra finomhangolták az NVIDIA Nemotron ASR-t
Az NVIDIA Nemotron 3.5 ASR-t szaúdi arab dialektusokra finomhangolták, 55,05%-ról 29,96%-ra csökkentve a hibaszázalékot, miközben az angol nyelvű felismerés is javult.

Az automatikus beszédfelismerésnek (ASR) kezelnie kell az emberek valós beszédét, nem csak azokat a nyelveket és stílusokat, amelyek dominálnak az előképzési adatokban. A regionális dialektusok és a helyi felvételi körülmények gyakran alulreprezentáltak, így egy többnyelvű modell, amely jól teljesít a széles körű benchmarkokon, mégis elmaradhat a bevezetéskor. (Nvidia Developer)
A szaúdi arab nyelv teszi ezt kézzelfoghatóvá. Egy modell felismerheti a modern standard arabot vagy az angolt, mégis nehézségei támadhatnak a nadzsdi és hijazi beszéddel, vagy a helyi felvételi körülményekkel. Csak a cél dialektusra történő finomhangolás javíthatja azt, miközben gyengíti más nyelveket.
Az NVIDIA Nemotron 3.5 ASR támogatja a többnyelvű streamelt transzkripciót 40 nyelv-lokálban, beleértve az arabot is, de a bevezetés-specifikus dialektusok és felvételi körülmények továbbra is előnyöket élveznek a finomhangolásból.
Ez a cikk bemutatja, hogyan lehet adaptálni az NVIDIA NeMo keretrendszerrel és az ASR finomhangolási recepttel: kuráljunk egy alacsony erőforrású corpuszt, építsünk súlyozott replay mixet, finomhangoljunk hatékony batchinggel, és értékeljük ki a transzkripciós minőséget egy független készleten. A munkafolyamat magában foglalja a minimális kurálást, a súlyozott replay mixelést FLEURS adatokkal, a hosszbeli bucketinget és a részleges encoder feloldást.
A finomhangolás 133,7 óra nadzsdi és hijazi beszédre csökkentette a hibaszázalékot (WER) 55,05%-ról 29,96%-ra a cél tesztfelosztáson, és javította az angol nyelvű teljesítményt 11,04%-ról 10,42%-ra anélkül, hogy más arab dialektusokat rontott volna. Az összes 24 encoder réteg frissítése érte el a legalacsonyabb hibaszázalékokat 230,4 millió tanítható paraméterrel, míg a rétegek fagyasztása csökkenti a számítási igényeket, ha kevés az adat vagy a memória.
Egy nagyobb, 13 lookahead keretet tartalmazó figyelmi kontextusra és beam-8 MALSD dekódolásra váltás 2,71 abszolút ponttal csökkentette a WER-t újratanítás nélkül, hozzáadva körülbelül 800 ms késleltetést, ami alkalmas kötegelt transzkripciós munkaterhelékekhez.
A munkafolyamat hasznos, ha elegendő címkézett beszéd áll rendelkezésre az ASR modell specializálásához, de nem elegendő az alapoktól való képzéshez: dialektus adaptáció, domain-specifikus transzkripció, olyan bevezetések, amelyeknek meg kell tartaniuk a meglévő nyelveket. A technikák különböző problémákat oldanak meg: a minimális kurálás eltávolítja a használhatatlan címkéket és az nyilvánvaló eltolódási hibákat anélkül, hogy elvetné a szűkös, nehéz beszédet.
A replay mixing kis mennyiségű korábban tanult adatot fűz be a katasztrofális elfelejtés csökkentése érdekében. A részleges encoder feloldás korlátozza, hogy hány paraméter változik – olcsóbb és gyorsabb, mint egy teljes finomhangolás, némi pontosságbeli költséggel. A hosszbeli bucketing csökkenti a paddingot és praktikussá teszi a streamelt encoderek képzését. A beam search és a nagyobb figyelmi kontextus késleltetés és számítási költség árán javíthatja az offline pontosságot újratanítás nélkül.
Az SADA kísérlethez a nadzsdi és hijazi dialektusokat választották ki. Az SADA adatkészletből 125 490 hangfelvételből 103 559-et tartottak meg, ami 133,7 órát jelent, azaz az eredeti készlet 82,5%-át. A cél a szerkezetileg rossz példányok eltávolítása volt, nem pedig a nehéz akcentusok vagy zajos beszéd elvetése pusztán azért, mert az alapmodell rosszul teljesít rajtuk. Az SADA kurálási folyamata az NVIDIA NeMo Curator segítségével standardizálta az audioanyagot és eltávolította a súlyosan degradálódott klipeket.
A MonoConversionStage a bemeneteket monóvá alakította, míg az UTMOSFilterStage és a SIGMOSFilterStage az észlelt minőséget és a háttérzajt pontozta. Az alapértelmezett küszöbértékek helyett először pontozási módban futtatták a szakaszokat, megvizsgálták a pontszámok eloszlását, majd corpusz-specifikus határértékeket állítottak be: UTMOS ≥ 1,25, SIGMOS zaj ≥ 1,5, SIGMOS összességében ≥ 1,5. Ezek az értékek az időtartam-érvényes minták körülbelül 85%-át fogadták el.
Az NVIDIA Nemotron 3 Diarization a munkafolyamatot a beszélőhöz rendelt transzkripcióra bővíti, akár nyolc beszélőig, a beszélő határok ASR időbélyegekhez igazításával többbeszélős környezetekben. A munkafolyamat reprodukálásához futtassa az ASR finomhangolási notebookot. Fedezze fel a Nemotron ASR finomhangolási skillt a recept irányított implementálásához. Olvassa el a Hugging Face blogot, hogy megtudja, hogyan adhat hozzá beszélő-azonosítást a finomhangolt ASR folyamathoz.