ÉlőUtoljára: 1 perceMa: 13
Modellek & LLMfrissítve: 09:30

Valós idejű multimodális AI-modell a Wan-Streamer — 200 ms válaszidővel

A kutatók által bemutatott Wan-Streamer egyetlen Transformer-architektúrában kezeli a nyelvet, hangot és videót, így kiküszöböli a korábbi rendszerek moduláris felépítéséből adódó késleltetést.

Valós idejű multimodális AI-modell a Wan-Streamer — 200 ms válaszidővel
Fotó: Growtika / Unsplash
forrás: ArXiv CV·AI Forradalom szerk.·
Megosztás

Egy új, end-to-end multimodális alapmodellt, a Wan-Streamert mutatott be egy kutatócsapat, amely valós idejű, alacsony, körülbelül 200 ezredmásodperces válaszidőt ígér a hang- és videokommunikációban. A modell a nyelvet, hangot és videót egyetlen Transformer-architektúrán belül kezeli, és a korábbi, több modulból álló rendszerek hibáit és késleltetését hivatott kiküszöbölni — állítják a szerzők. (ArXiv CV)

A Wan-Streamer nem használ külső modulokat a beszéd- és képfelismeréshez, szöveggeneráláshoz vagy animációhoz. Ehelyett a percepció, érvelés, generálás, válaszidőzítés és a különböző modalitások közötti szinkronizációt egyetlen, integrált modellben tanulja meg. Ez az egységes megközelítés csökkenti a feldolgozási időt és a hibalehetőségeket, ami kulcsfontosságú a természetes, emberihez hasonló interakciókhoz.

Kapcsolódó: Képgenerálás új korszaka

Valós idejű adatfolyamok kezelése

A modell architektúráját az adatfolyamok hatékony kezelésére tervezték. Kausális enkódereket és dekódereket, valamint blokk-kausális figyelmet (block-causal attention) használ, ami lehetővé teszi a streamelési egységek akár 160 ezredmásodperces feldolgozását 25 képkocka/másodperc sebesség mellett. A szerzők becslései szerint a modelloldali válaszidő körülbelül 200 ms, ami a 350 ms-os hálózati késleltetéssel együtt körülbelül 550 ms-os teljes interakciós időt eredményez.

Kapcsolódó: Multimodális AI fejlődése

Potenciális alkalmazási területek

Az alacsony késleltetésű, valós idejű multimodális interakcióra képes Wan-Streamer potenciálisan forradalmasíthatja az interaktív virtuális asszisztenseket, az élő közvetítésekhez kapcsolódó alkalmazásokat vagy az interaktív avatarokat. Az egységes, end-to-end megközelítés lehetővé teszi a zökkenőmentesebb és természetesebb kommunikációt a gépek és az emberek között.

Kapcsolódó: Multimodális AI tesztelése

A kutatás eredményeit a szerzők előnyomtatott formában tették közzé az arXivon, további független ellenőrzésre várva.

Kapcsolódó: Többnyelvű átírás

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom