Valós idejű beszédfelismerőt adott ki olcsón a Meta, 20+ beszélőt is megkülönböztet
Az új Muse Voice Transcribe modell óránként 0,18 dolláros áron kínál valós idejű transzkripciót és több mint 20 hangszóró megkülönböztetését. A Meta Superintelligence Labs fejlesztése a beszédet valós időben dolgozza fel, nem várja meg a felvétel végét.

A Meta belép a valós idejű beszédfelismerő piacra a Muse Voice Transcribe modellel. Az új audio-percepciós megoldás streaming transzkripciót, végpont-detektálást és több mint 20 hangszóró megkülönböztetését (diarizációt) kínálja, mindezt óránként mindössze 0,18 dolláros nyilvános API-díjon. (VentureBeat)
A modellt több mint 70 nyelven tanították be, ebből 25-öt validáltak alaposan a kezdeti kiadáshoz. A Meta Superintelligence Labs által fejlesztett rendszer támogatja az egyóránál hosszabb hanganyagokat, a zökkenőmentes többnyelvű kódváltást, valamint a nyelvi és kulcsszóbeli elhajlást külön utófeldolgozási folyamat nélkül.
Többnyelvű támogatás és nyelvi validálás
A Meta Superintelligence Labs által fejlesztett Muse a beszédet valós időben dolgozza fel, nem várja meg a felvétel befejezését. Ez a technológia lehetővé teszi a dinamikus kontextuskezelést, amely kulcsfontosságú a valós idejű alkalmazásokban.
Árazás és piaci pozicionálás
A Meta 0,18 dolláros óránkénti ára versenyképessé teszi a modellt. A Muse Voice Transcribe óránként 3 dollárba kerül 1000 perc feldolgozott hanganyag után. A streaming és a nem streaming transzkripció ára megegyezik, és a nulla adatmegőrzésű feldolgozás is azonos áron fut. Összehasonlításképpen, a Soniox 0,12 dollárért kínálja ugyanezt 15 hangszóróval, míg az xAI 0,20 dollárért támogatja a diarizációt, a Speechmatics pedig 0,24 dollárért 50-100 hangszórót kínál.
A diarizáció egyre fontosabbá válik a hangfeldolgozásban. Míg a hagyományos beszédfelismerés csak azt mondja meg, mi hangzott el, a diarizáció azt is hozzáteszi, hogy ki mondta. Ez kritikus, amikor a transzkriptumok további AI-rendszereket táplálnak. Egy tárgyalási asszisztens például tévesen tulajdoníthat egy jóváhagyást vagy kifogást a rossz résztvevőnek, ha nem tudja pontosan megkülönböztetni a hangszórókat.
A Muse a hangérzékelési architektúrájába építi be a hangszóró-azonosítást. A Meta szerint a hang 80 milliszekundumos darabokban érkezik, és minden darab puha tokenné alakul. A modell minden lépésnél eldönti, hogy több hangot fogyaszt-e, vagy szöveget bocsát-e ki. Ezt a mechanizmust adaptív késleltetésnek nevezik: a Muse hosszabb ideig várhat, ha a beszéd kétértelmű, és korábban dönthet, ha elegendő kontextusa van. A Meta megerősítő tanulással kombinálja a szóhiba-arány és a késleltetési jutalmakat a viselkedés tanítására.
A 20-nál több hangszóró megkülönböztetésére képes képesség jelentős, de nem világrekord. A piacon vannak olyan rendszerek, amelyek ennél magasabb számot is publikálnak; a Speechmatics például 50, akár 100 hangszórót is képes azonosítani, az Amazon Transcribe pedig 30 egyedi hangszórót tud megkülönböztetni. A Muse ugyanakkor a piac felső szegmensébe pozicionálja magát, és a Meta fő ajánlata az, hogy a nagy kapacitású valós idejű diarizációt alacsony késleltetésű transzkripcióval, többnyelvűséggel és agresszív API-árazással ötvözi.
A Meta bemutatóiban nyolc, illetve 11 hangszóró szerepel. A 20+ szám egy megadott modellképesség, nem a demonstrációkban szereplő résztvevők száma.