ÉlőUtoljára: 25 perceMa: 11
Kutatásfrissítve: 22:30

Hangügynökök küzdelme a kétnyelvű beszéddel: a kódváltás modelltől függő költsége

A hangügynökök nehezen kezelik a kódváltott beszédet, ami jelentős hibaarányt eredményezhet. Az ElevenLabs Scribe V2, a Gemini 3 Flash és az Assembly AI Universal 3-Pro modellek bizonyultak a legjobbnak a tesztek során.

Hangügynökök küzdelme a kétnyelvű beszéddel: a kódváltás modelltől függő költsége
Fotó: Dmytro Vynohradov / Unsplash
forrás: Hugging Face·AI Forradalom szerk.·
Megosztás

A világ lakosságának több mint fele kétnyelvű, sokan közülük természetesen váltanak nyelvet akár mondat közben is. Ez a kódváltás azonban kihívást jelent a hangügynökök számára, különösen vállalati környezetben, ahol a pontatlan transzkripció komoly következményekkel járhat. A ServiceNow-AI ezért saját teljesítménytesztet és adathalmazt hozott létre a probléma feltárására. (Hugging Face)

A kutatás az automatikus beszédfelismerésre (ASR) összpontosított, amely minden hangügynök első lépése. A teszt négy, az ügyfélbázisuk szempontjából releváns nyelvpárost vizsgált: spanyol-angol, francia-angol, kanadai francia-angol és német-angol. Az adatok HR- és IT-szolgáltatási forgatókönyveket fednek le, mint például bérszámfejtési vagy jelszó-visszaállítási kérések.

Kapcsolódó: LLM-ek korlátja

A ServiceNow-AI három metrikát használt a modellek teljesítményének mérésére: Word Error Rate (WER), Semantic Word Error Rate (SWER) és Answer Error Rate (AER). Ezek a mutatók nemcsak a pontos transzkripciót, hanem a beszéd jelentésének megőrzését is vizsgálják a későbbi feldolgozáshoz. A kutatók közzétették benchmarkjukat és az eredményeket, amelyek hét ASR rendszert értékelnek.

Kapcsolódó: EVA keretrendszer

A fő megállapítás, hogy a kódváltás költsége eltérő a nyelvpárok és a tesztelt modellek között. Az ElevenLabs Scribe V2, a Google Gemini 3 Flash és az Assembly AI Universal 3-Pro bizonyult a legjobb modelleknek a feladat elvégzésében. A WER eredmények alapján az ElevenLabs Scribe V2 és az AssemblyAI Universal-3 Pro vezeti a mezőnyt a transzkripciós pontosságban, szorosan követve őket a Gemini 3 Flash-sel. Az OpenAI Whisper Large V3 Turbo a lista végén kullog, mivel alapértelmezetten angolra fordít, nem pedig transzkribál kódváltott hanganyag esetén.

Kapcsolódó: Zhejiang Egyetem

A semanticus metrikák, az SWER és az AER, hasonló képet festenek, bár néhány sorrendbeli eltéréssel. Az adatok elemzése során kiderült, hogy a kódváltás költsége a nyelvpárok és a modellek függvényében változik, a WER értékek 0.16 és 0.61 között mozogtak. A ServiceNow-AI a kutatási eredményeket az AU-Harness platformjukon keresztül teszi elérhetővé.

Kapcsolódó: beszédfelismerés

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom