Az Nvidia ingyenes, 100 milliós modellt ad ki a beszédazonosításhoz
Az Nvidia ingyenesen elérhetővé tette Nemotron 3 Diarization modelljét, amely képes valós időben megkülönböztetni akár nyolc beszélőt, és 14.7%-os hibahatárral dolgozik.

Az Nvidia kiadta a Nemotron 3 Diarization modellt, amely képes azonosítani, hogy egy beszélgetésben éppen ki beszél. A mintegy 100 millió paraméterrel rendelkező modell súlyai szabadon elérhetők.
A Nemotron 3 képes elkülöníteni akár nyolc különböző hangot, és felismeri, ha többen egyszerre szólalnak meg. Több résztvevő, erős háttérzaj vagy visszhang növeli a hibaszázalékot. Beszédazonosító rendszerrel, például a Parakeettel párosítva a modell névtelen, például „speaker_2” jelölésű hangcímkékkel ellátott átiratokat képes készíteni. Felvett és élő hanganyagokkal egyaránt működik.
A VoiceArena Diarization teljesítményteszt v1 teszten az ingyenes Nemotron 3 14.7%-os hibahatárral (DER) vezet, és 41%-kal múlja felül elődjét, a Streaming Sortformert. A hangpuffer négy szinten állítható be, 30.4 másodperctől egészen 0.32 másodpercig; rövidebb pufferek általában csökkentik a pontosságot.
A Diarization-Bench teszten a modell jelenleg 14.72%-os hibahatárral az első helyen áll, megelőzve a következő legjobb, 19.3%-os eredményt elérő rendszert. A teljesítményteszt szigorú: az átfedő beszéd, valamint az apró eltolódások a hangváltásoknál is hibapontnak számítanak. Elődjéhez, a Streaming Sortformerhez képest az új modell átlagosan 41%-kal csökkenti a hibahatárt nyolc tesztesetben, 1.04 másodperces puffer használatával — közölte a The Decoder.