Folyamatosan figyel az új, nyílt forráskódú AI-modell, 0,4 másodpercenként dönt a megszólalásról
A Gemini 3 Flash-t is legyőzte zajészlelési teszteken az Audio Interaction modell. A modell 302 000 órányi adathalmazon tanult.

Az "Audio Interaction" nevű, nyílt forráskódú AI-modell egyszerre képes folyamatosan figyelni és beszélni, minimalizálva a válaszidőt. A kutatók célja, hogy áthidalják a különbséget a mai hangmodellek és az emberi hallás között. (The Decoder)
A modell a hangfolyamot 0,4 másodperces szeletekre bontja, és minden szelet után eldönti, hogy csendben maradjon-e, vagy válaszoljon. Ez a megközelítés lehetővé teszi a párbeszéd, fordítás, átírás és hangfelismerés egyetlen rendszerben történő kombinálását. A 302 000 órányi mesterséges adathalmazon betanított modell a hagyományos, gombnyomásra működő rendszerekkel szemben proaktívan reagál, és a zajészlelési teszteken legyőzte a Gemini 3 Flash-t is.
Kapcsolódó: GPT-5 hangmodell
A modell teljesítménye
A kutatók által publikált tanulmány szerint az Audio Interaction 58,15 pontot szerzett az MMAU hangbenchmarkon, ezzel kissé megelőzve alapmodelljét, a Qwen2.5-Omni-3B-t. A modell teljesítménye megközelíti a sokkal nagyobb, 7 milliárd paraméteres modellekét is, és jelentősen javul az angol-kínai fordításban az alapmodellhez képest.
Kapcsolódó: beszédfelismerési ranglista
Mesterséges adathalmaz
A modell betanításához a kutatók egyedi, mesterséges adathalmazt hoztak létre, mivel a létező adatkészletek nem tartalmaztak elegendő hosszú, ritka válaszjelű szekvenciát. A StreamAudio-2M nevű adatkészlet 2,6 millió egységet és mintegy 302 000 órányi hanganyagot foglal magában hét különböző készségterületen és 28 alfeladaton.
Kapcsolódó: Stable Audio 3.0
A modell a GitHubon Apache 2.0 licenc alatt elérhető, a letöltési útmutatóval együtt, kereskedelmi használatra korlátozás nélkül, 2026-tól kezdve.
Kapcsolódó: Realtime TTS-2 modell