Hangügynökök küzdelme a kétnyelvű beszéddel: a kódváltás modelltől függő költsége
A hangügynökök nehezen kezelik a kódváltott beszédet, ami jelentős hibaarányt eredményezhet. Az ElevenLabs Scribe V2, a Gemini 3 Flash és az Assembly AI Universal 3-Pro modellek bizonyultak a legjobbnak a tesztek során.

A világ lakosságának több mint fele kétnyelvű, sokan közülük természetesen váltanak nyelvet akár mondat közben is. Ez a kódváltás azonban kihívást jelent a hangügynökök számára, különösen vállalati környezetben, ahol a pontatlan transzkripció komoly következményekkel járhat. A ServiceNow-AI ezért saját teljesítménytesztet és adathalmazt hozott létre a probléma feltárására. (Hugging Face)
A kutatás az automatikus beszédfelismerésre (ASR) összpontosított, amely minden hangügynök első lépése. A teszt négy, az ügyfélbázisuk szempontjából releváns nyelvpárost vizsgált: spanyol-angol, francia-angol, kanadai francia-angol és német-angol. Az adatok HR- és IT-szolgáltatási forgatókönyveket fednek le, mint például bérszámfejtési vagy jelszó-visszaállítási kérések.
Kapcsolódó: LLM-ek korlátja
A ServiceNow-AI három metrikát használt a modellek teljesítményének mérésére: Word Error Rate (WER), Semantic Word Error Rate (SWER) és Answer Error Rate (AER). Ezek a mutatók nemcsak a pontos transzkripciót, hanem a beszéd jelentésének megőrzését is vizsgálják a későbbi feldolgozáshoz. A kutatók közzétették benchmarkjukat és az eredményeket, amelyek hét ASR rendszert értékelnek.
Kapcsolódó: EVA keretrendszer
A fő megállapítás, hogy a kódváltás költsége eltérő a nyelvpárok és a tesztelt modellek között. Az ElevenLabs Scribe V2, a Google Gemini 3 Flash és az Assembly AI Universal 3-Pro bizonyult a legjobb modelleknek a feladat elvégzésében. A WER eredmények alapján az ElevenLabs Scribe V2 és az AssemblyAI Universal-3 Pro vezeti a mezőnyt a transzkripciós pontosságban, szorosan követve őket a Gemini 3 Flash-sel. Az OpenAI Whisper Large V3 Turbo a lista végén kullog, mivel alapértelmezetten angolra fordít, nem pedig transzkribál kódváltott hanganyag esetén.
Kapcsolódó: Zhejiang Egyetem
A semanticus metrikák, az SWER és az AER, hasonló képet festenek, bár néhány sorrendbeli eltéréssel. Az adatok elemzése során kiderült, hogy a kódváltás költsége a nyelvpárok és a modellek függvényében változik, a WER értékek 0.16 és 0.61 között mozogtak. A ServiceNow-AI a kutatási eredményeket az AU-Harness platformjukon keresztül teszi elérhetővé.
Kapcsolódó: beszédfelismerés