OpenAI új beszédfelismerője, a GPT Transcribe 34-szer gyorsabb elődjénél
Az OpenAI új GPT Transcribe és GPT Live Transcribe modelljei 34-szer gyorsabban dolgozzák fel a hanganyagot elődjüknél, miközben az áruk is 25%-kal csökkent.

Az OpenAI bemutatta a GPT Transcribe és GPT Live Transcribe új beszédfelismerő modelljeit, amelyek API-n keresztül érhetők el. A GPT Transcribe előre rögzített hangfájlokat dolgoz fel, körülbelül 34-szer gyorsabban a valós idejű sebességnél. A GPT Live Transcribe alacsony késleltetésű, valós idejű streamekre épül. A beszédfelismerő modellek a GPT-4o Transcribe-hoz képest 0,7 százalékpontos javulást értek el, így 3,31%-os szótévesztési rátát (WER) produkálnak az Artificial Analysis AA-WER benchmarkja szerint — írja a The Decoder.
Az árcsökkentés is jelentős: a percenkénti díj 25%-kal esett vissza, így most $0,0045 percenként a hanganyag feldolgozása. Mindkét modell képes kontextus, kulcsszavak és több bemeneti nyelv elfogadására a transzkripció során.
A riválisok pontossága
Az AA-WER ranglistáján az OpenAI modelljei továbbra is lemaradnak több versenytárs mögött. Az ElevenLabs Scribe v2 2,3%-os hibaszázalékkal vezet, őt követi a Google Gemini 3 Pro 2,9%-kal, majd a Mistral Voxtral Small 3%-kal. A Mistral nemrégiben még alacsonyabb áron, $0,003 percért kínálja a Voxtral Transcribe V2 modellt.
A GPT Transcribe WER-értéke (3,31%) és a 0,7 pp javulás az AA‑WER teljesítményteszt szerint történt. Az árcsökkenés $0,0045/perc az OpenAI által közölt árak alapján.
Az új transzkripciós modellek kiegészítik az OpenAI nemrég bejelentett Realtime modellgenerációját, amely magában foglalja a GPT-Realtime-Whisper valós idejű transzkripciós modellt is.