Új teljesítményteszt teszteli a videógeneráló AI-k látásmódját
A videógeneráló AI-k vizuális érvelési képességeit tesztelő VGI-bench teljesítményteszt 27 feladattal és 810 példával méri a modellek teljesítményét.

Az értékelés során kiderült, hogy még a legerősebbnek számító Seedance 2.0 modell is csupán 51,0%-os eredményt ért el a VGI-bench kritériumai szerint, ami azt mutatja, hogy a jelenlegi rendszerek megbízhatósága messze elmarad a kívánatostól. (ArXiv CV)
A modellek érvelési hibái
Az elemzés feltárta a modellek kimeneti hibáit, az input feltételek érzékenységét, valamint a szintetikus finomhangolásból származó teljesítményátviteli határokat. Kiderült, hogy a modellek öntisztulási képessége korlátozott; a későbbi lépések inkább a korai hipotéziseket finomítják, mintsem a következtetési hibákat javítanák.
Az új teljesítményteszt segít a következő generációs videógeneráló modellek fejlesztésében. A kutatók ígéretet tettek arra, hogy kiadják a kódot és az adatokat a szélesebb körű kutatások támogatására.
A Stream4D megközelítése
A videógenerálás területén a Stream4D nevű új megközelítés a valós idejű, hosszú horizontú videógenerálást célozza. Ez a módszer a statikus kritikusok helyett egy 4D rekonstrukciós jutalmat használ, amely explicit módon modellezi a jelenet dinamikáját, így a koherens mozgás magas jutalmat kap.
A Stream4D a mozgás nagyságát és minőségét is finomhangolja egy mozgási előjelzéssel, amely természetes jelenetáramlási nagyságot jutalmaz, miközben a rángatást és a nem-merev artefaktokat bünteti. Ez a recept a két elem kombinációját, valamint egy könnyűsúlyú, észlelési horgonyt foglal magában.
A Stream4D javítja a 4D rekonstrukciós minőséget, hatékonyabban őrzi meg a mozgást, és magasabb emberi preferenciát ér el az autoregresszív videó alapmodelleken és különböző generációs horizontokon keresztül.