Valós idejű multimodális AI-modell a Wan-Streamer — 200 ms válaszidővel
A kutatók által bemutatott Wan-Streamer egyetlen Transformer-architektúrában kezeli a nyelvet, hangot és videót, így kiküszöböli a korábbi rendszerek moduláris felépítéséből adódó késleltetést.

Egy új, end-to-end multimodális alapmodellt, a Wan-Streamert mutatott be egy kutatócsapat, amely valós idejű, alacsony, körülbelül 200 ezredmásodperces válaszidőt ígér a hang- és videokommunikációban. A modell a nyelvet, hangot és videót egyetlen Transformer-architektúrán belül kezeli, és a korábbi, több modulból álló rendszerek hibáit és késleltetését hivatott kiküszöbölni — állítják a szerzők. (ArXiv CV)
A Wan-Streamer nem használ külső modulokat a beszéd- és képfelismeréshez, szöveggeneráláshoz vagy animációhoz. Ehelyett a percepció, érvelés, generálás, válaszidőzítés és a különböző modalitások közötti szinkronizációt egyetlen, integrált modellben tanulja meg. Ez az egységes megközelítés csökkenti a feldolgozási időt és a hibalehetőségeket, ami kulcsfontosságú a természetes, emberihez hasonló interakciókhoz.
Kapcsolódó: Képgenerálás új korszaka
Valós idejű adatfolyamok kezelése
A modell architektúráját az adatfolyamok hatékony kezelésére tervezték. Kausális enkódereket és dekódereket, valamint blokk-kausális figyelmet (block-causal attention) használ, ami lehetővé teszi a streamelési egységek akár 160 ezredmásodperces feldolgozását 25 képkocka/másodperc sebesség mellett. A szerzők becslései szerint a modelloldali válaszidő körülbelül 200 ms, ami a 350 ms-os hálózati késleltetéssel együtt körülbelül 550 ms-os teljes interakciós időt eredményez.
Kapcsolódó: Multimodális AI fejlődése
Potenciális alkalmazási területek
Az alacsony késleltetésű, valós idejű multimodális interakcióra képes Wan-Streamer potenciálisan forradalmasíthatja az interaktív virtuális asszisztenseket, az élő közvetítésekhez kapcsolódó alkalmazásokat vagy az interaktív avatarokat. Az egységes, end-to-end megközelítés lehetővé teszi a zökkenőmentesebb és természetesebb kommunikációt a gépek és az emberek között.
Kapcsolódó: Multimodális AI tesztelése
A kutatás eredményeit a szerzők előnyomtatott formában tették közzé az arXivon, további független ellenőrzésre várva.
Kapcsolódó: Többnyelvű átírás