ÉlőUtoljára: 1 órájaMa: 3
Kutatásfrissítve: 04:18

Új valós idejű hangügynök-teljesítménytesztet jelentett az Artificial Analysis

A valós idejű hangügynökök sebességét leggyakrabban a TTFT (Time-to-First-Token) alapján választják, ám ez a mérőszám félrevezető lehet. A tényleges felhasználói élményt a TTFS (Time-to-First-Sentence) határozza meg, amelynek ideális esetben 800 ms a célja.

Új valós idejű hangügynök-teljesítménytesztet jelentett az Artificial Analysis
Fotó: National Institute of Allergy and Infectious Diseases / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A hangalapú AI-ügynökök fejlesztői számára a sebesség kulcsfontosságú, ám a leggyakrabban használt mérőszám, a TTFT (Time-to-First-Token) nem ad teljes képet a felhasználói élményről. Az Artificial Analysis új benchmarkja rávilágít, hogy a teljes beszédkésleltetés, azaz a TTFS (Time-to-First-Sentence) sokkal relevánsabb a konverzációszerű interakciók szempontjából. (MarkTechPost)

A TTFT azt jelzi, mikor indul el a generálás, de egy szöveg-beszéd (TTS) modell csak teljes mondat vagy záradék után tud hangot szintetizálni. A LiveKit által javasolt TTFS méri ezt a tényleges késleltetést.

A kutatás szerint egy valós idejű hangügynök számára a teljes end-to-end késleltetési keret 700 ms és 1,2 másodperc között mozog, ideális esetben 800 ms median voice-to-voice latenciával, és legfeljebb 1500 ms a proof-of-concept fázisban. Ez a költségvetés nagyjából 200 ms-ra osztódik a különböző komponensekre: szállítás (network), beszédfelismerés (STT), LLM-inferencia és szöveg-beszéd szintézis (TTS).

A TTFT-mérés buktatói

Az Artificial Analysis kiemeli, hogy a TTFT-számokat nagymértékben befolyásolják a mérési módszertan tényezői. Ilyen például a munkaterhelés mérete: a korábbi 1000 bemeneti token helyett már 10 000 tokent használnak, ami növeli a TTFT-t, de közelebb áll a valós produkciós ügynökök igényeihez. A szerver helyszíne is számít, mivel a mérések a Google Cloud us-central1-a zónájából indulnak, így a hálózati késleltetés is beépül az eredményekbe.

Fontos különbséget tesznek a modell első „reasoning” tokenje és az első válasz tokenje között is, valamint azt is figyelembe veszik, hogy a szolgáltatók néha csak belső stack-jükön belül mérik a TTFT-t, míg a teljesítményteszt a kérés küldésétől az első használható tokenig tart. A futtatások megismételhetetlensége is kihívást jelent, mivel a szolgáltatók értesítés nélkül is változtathatnak az infrastruktúrájukon.

LLM-inferencia sebessége

Az LLM-ek TTFT-eredményei között jelentős eltérések mutatkoznak. A Baseten gpt-oss-120b modell (high) 0,23 másodperces TTFT-vel és 266 tok/s sebességgel végzett az élen. A DeepInfra Nemotron 3 Ultra 0,28 másodperc alatt teljesített, míg a Cohere North Mini Code 0,32 másodpercet ért el. A Cerebras és a Groq rendszerei is figyelemre méltóak: bár TTFT-jük magasabb lehet, kiemelkedő átviteli sebességet kínálnak, ami a TTFS szempontjából előnyös. Az Inception Mercury 2 modell 3,07 másodperces TTFT-vel és 770 tok/s sebességgel végzett a lista végén, ami a teljes LLM-költségvetés négyszerese.

Szolgáltatói és egyedi megoldások

A különböző felhőszolgáltatóknál futtatott azonos modellek is eltérő eredményeket produkálhatnak. Például a GPT-5.6 Luna modell 0,59 másodpercet mért az Amazon Bedrockon, míg az OpenAI saját API-ján 0,74 másodpercet. A LiveKit saját inference termékénél Gemma 4 31B modellje 192 ms TTFT-t ért el, ami kiemelkedően jó eredmény, ám ez a megoldás magasabb költséggel jár. A LiveKit által közölt TTFS-eredmények is alátámasztják a Gemma 4 31B kiválóságát, 354 ms-mal, míg a Gemini 2.5 Flash 1034 ms-ot, a GPT-4.1 pedig 1088 ms-ot ért el.

A kutatás kiemeli, hogy a sebesség mellett a képességek is fontosak. A Gemma 4 31B modell az IFBench teljesítményteszten 75,6%-ot ért el, míg a GPT-5.5 75,9%-ot. A τ²-bench teszten a GPT-5.5 vezet 93,9%-kal, a Gemma 4 31B pedig 76,9%-kal követi.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom