ÉlőUtoljára: az iméntMa: 6
Modellek & LLMfrissítve: 05:16

Az összes indiai nyelvre képes beszédfelismerőt adott ki a Sarvam AI

A Sarvam AI új, Saaras V4 nevű beszédfelismerő modellje 22 indiai nyelvet és globális angol akcentusokat fed le, a gyártó szerint state-of-the-art pontossággal.

Az összes indiai nyelvre képes beszédfelismerőt adott ki a Sarvam AI
Fotó: AHEN AHEN / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A Saaras V4 egy encoder-decoder rendszeren alapul. Egy audio encoder alakítja át a hanghullámot beágyazásokká, amelyek fonetikai és akusztikai részleteket hordoznak. Ezt követően egy temporal-downsampling adapter rövidíti le a szekvenciát, és beilleszti a nyelvi modell embedding terébe. Ez lehetővé teszi, hogy a hosszú felvételek is beleférjenek a decoder kontextus-keretébe. A decoder a Sarvam-3B, egy 3 milliárd paraméteres, házon belül, teljesen új alapokról betanított hibrid state-space nyelvi modell. (MarkTechPost)

Angol nyelvű pontosság és adatkészletek

A modell angol nyelvű teljesítményét hét adatkészleten értékelte a Sarvam AI. Hat az adatkészlet közül a Hugging Face Open ASR Leaderboardjáról származik: AMI, GigaSpeech, LibriSpeech clean, LibriSpeech other, SPGISpeech és VoxPopuli. A hetedik az AI4Bharat indiai akcentusokat tartalmazó Svarah adatkészlete. A Sarvam V4 a cég által mért modellek közül a legalacsonyabb átlagos WER (Word Error Rate) értéket produkálta ezeken az adatkészleteken.

Indiai nyelvek, kimeneti módok és streaming

Az indiai nyelvek esetében a Vistaar adatkészleten mért eredmények WER és LLM-WER (szemantikai ellenőrzést is tartalmazó WER) értékeket is magukban foglalnak. A Kathbath Noisy adatkészleten, LLM-WER-rel mérve, a Saaras V4 hibarátája a Deepgram Nova-3 és a GPT-4o Transcribe hibarátájának fele alatt van. A zajos hangfelvételek közé tömörített, csonkolt és háttérzajjal terhelt felvételek tartoznak. A nyelvazonosítási hiba a top 10 indiai nyelven 2,9%, mind a 22 nyelven pedig 5,22% a Sarvam AI szerint.

A Saaras V4 egyetlen modellből ötféle kimeneti módot kínál: transcribe (alapértelmezett, natív szkriptben, normalizált számokkal és dátumokkal), verbatim (minden kimondott szót, beleértve a töltelékszavakat és kimondott számokat), codemix (natív szkript, angol szavakat angolul hagyva), translit (teljes beszéd latin betűs átírással) és translate (angol fordítás, normalizált számokkal). A Sarvam AI szerint ez a megközelítés kiküszöböli a hibákat halmozó utófeldolgozási lépéseket.

Az új kulcsszó-promptolási funkcióval a felhasználók akár 50, egyenként 64 karakteres kulcsszót is megadhatnak JSON listában, amelyek befolyásolják az elismerést. Az IndicContextEval teljesítményteszten a Saaras V4 16,03%-os WER-t ért el az L5 kulcsszó-promptolási beállításban, ami a cég szerint a legalacsonyabb pontszám ezen a teljesítményteszten.

A modell valós idejű streaming támogatást kínál WebSocket protokollal, 150 ms alatti első token késleltetéssel. Hosszú, akár 2 órás hangfájlok feldolgozására is alkalmas kötegelt módban, opcionális hangszóró-azonosítással. Az API ma már elérhető, a díjszabás pedig 30 INR óránként a valós idejű és kötegelt feldolgozáshoz, illetve 45 INR óránként hangszóró-azonosítással. A Sarvam-3B modell használata mellett a Saaras v3 marad az alapértelmezett modell, de a V4-re való váltás egyetlen soros kódmódosítást igényel.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom