Bemutatta az Avatar V modellt, amely 100 millió videóból tanult
Az Avatar V modell 100 millió videóból tanult, hogy korlátlan ideig tartó, 1080p felbontású avatar videókat generáljon, hűen megőrizve a személyiségjegyeket és a mozgásdinamikát.

Az Avatar V nevű új AI-keretrendszer képes korlátlan ideig tartó, 1080p felbontású avatar videók létrehozására, amelyek vizuálisan és viselkedésükben is hűek az eredeti személyhez. A modell a korábbi módszerekkel ellentétben nem statikus képekből, hanem teljes videókból tanulja meg a személyiségjegyeket, beleértve a beszédritmust, a gesztusokat és az arckifejezéseket. (ArXiv CV)
A kutatók által az ArXivon publikált tanulmány szerint az Avatar V a többi vezető rendszerhez, mint a Seedance 2.0, Kling O3 Pro, Veo 3.1 és OmniHuman 1.5, képest felülmúlni automatizált mérőszámokban és emberi értékelésben egyaránt. A modell a referencia videó teljes token-szekvenciájára kondicionál, így képes megőrizni a statikus identitásjegyeket, mint az arcgeometria és a bőr textúrája, valamint a dinamikus viselkedésmintákat.
Kapcsolódó: képvideó készítés
Az identitásmegőrzés új dimenziói
Az Avatar V egyik kulcsfontosságú újítása a Sparse Reference Attention mechanizmus, amely lineáris komplexitással teszi lehetővé a tetszőleges hosszúságú referencia videók feldolgozását. Ezt kiegészíti egy mozgásreprezentációs stream a zártkörű beszédstílus-átvitelhez, valamint egy identitás-tudatos szuper-felbontású finomító, amely szintén a teljes referencia-kondicionálásra épít.
Kapcsolódó: képgenerálás
Adatbázis és képzési folyamat
A modell betanításához egy nagyszabású adatbázist használtak, amely több mint 100 millió képkockát tartalmaz 50 millió nyers videóból. A képzési folyamat öt szakaszból áll: flow matching előképzés, személyiség finomhangolás, kétszintű desztilláció (több mint tízszeres gyorsulással) és RLHF (Reinforcement Learning from Human Feedback) igazítás. A folyamatot több ezer GPU-n futtatták.
Kapcsolódó: 3D avatarok
Az Avatar V képességeit egy új, több jelenetet magában foglaló teljesítményteszten tesztelték, ahol kiemelkedő eredményeket ért el az identitásmegőrzés, a szinkronizálás és az általános generálási minőség terén. A kutatók szerint ez a megközelítés jelentős előrelépést jelent a valósághű avatar videók generálásában.
Kapcsolódó: avatár irányítás
A kutatás eredményeit az ArXivon tették közzé a kutatók, ahol a modell 100 millió videóból tanult, és 1080p felbontású avatar videókat generál.
Kapcsolódó: AI-világok szinkronizálása