ÉlőUtoljára: 38 perceMa: 21
Modellek & LLMfrissítve: 14:16

Az Nvidia ingyenes, 100 milliós modellt ad ki a beszédazonosításhoz

Az Nvidia ingyenesen elérhetővé tette Nemotron 3 Diarization modelljét, amely képes valós időben megkülönböztetni akár nyolc beszélőt, és 14.7%-os hibahatárral dolgozik.

Az Nvidia ingyenes, 100 milliós modellt ad ki a beszédazonosításhoz
Fotó: Mariia Berezovsky / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

Az Nvidia kiadta a Nemotron 3 Diarization modellt, amely képes azonosítani, hogy egy beszélgetésben éppen ki beszél. A mintegy 100 millió paraméterrel rendelkező modell súlyai szabadon elérhetők.

A Nemotron 3 képes elkülöníteni akár nyolc különböző hangot, és felismeri, ha többen egyszerre szólalnak meg. Több résztvevő, erős háttérzaj vagy visszhang növeli a hibaszázalékot. Beszédazonosító rendszerrel, például a Parakeettel párosítva a modell névtelen, például „speaker_2” jelölésű hangcímkékkel ellátott átiratokat képes készíteni. Felvett és élő hanganyagokkal egyaránt működik.

A VoiceArena Diarization teljesítményteszt v1 teszten az ingyenes Nemotron 3 14.7%-os hibahatárral (DER) vezet, és 41%-kal múlja felül elődjét, a Streaming Sortformert. A hangpuffer négy szinten állítható be, 30.4 másodperctől egészen 0.32 másodpercig; rövidebb pufferek általában csökkentik a pontosságot.

A Diarization-Bench teszten a modell jelenleg 14.72%-os hibahatárral az első helyen áll, megelőzve a következő legjobb, 19.3%-os eredményt elérő rendszert. A teljesítményteszt szigorú: az átfedő beszéd, valamint az apró eltolódások a hangváltásoknál is hibapontnak számítanak. Elődjéhez, a Streaming Sortformerhez képest az új modell átlagosan 41%-kal csökkenti a hibahatárt nyolc tesztesetben, 1.04 másodperces puffer használatával — közölte a The Decoder.

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom