Új videóárnyék-eltávolító modell, a WildShadowRemover, kiemelkedő minőséget ígér
A WildShadowRemover egy előre betanított videó diffúziós modellt adaptál LoRA finomhangolással, és a Depth Anything 3 monokuláris mélységi előzeteket használ a geometriai útmutatáshoz. A kutatók ehhez a WildShadow nevű, nagyméretű, párosított videó adathalmazt is létrehozták.

A videókban megjelenő árnyékok eltávolítása eddig nehézkes volt a komplex megvilágítás, a változatos árnyékok és a korlátozott képzési adatok miatt. Bár számos vizuális és grafikai alkalmazásban fontos lenne, a valós, megkötés nélküli forgatókönyvekben ez a terület nagyrészt feltáratlan maradt — állítja az arXiv-en publikált tanulmányukban a kutatók egy csoportja. (ArXiv CV)
A WildShadowRemover egy olyan keretrendszer, amely egy előre betanított videó diffúziós modellt adaptál a robusztus árnyékeltávolításhoz LoRA finomhangolással. A modell képes megőrizni a finom kép részleteket, miközben a VAE dekóderét egy részletinjektáló modullal egészíti ki. Emellett egy árnyékmaszk által vezérelt, frekvenciadekomponált modulációt is alkalmaz a magas frekvenciájú textúrák helyreállítására, miközben elnyomja az árnyékok okozta műtermékeket. A Depth Anything 3 monokuláris mélységi előzetesek geometriára érzékeny útmutatást nyújtanak a kihívást jelentő fényviszonyok között.
Új adathalmaz és teljesítményteszt
A kutatók létrehozták a WildShadow-t, egy nagyméretű, párosított videó árnyékeltávolítási adathalmazt és teljesítménytesztet, amely különféle szimulált jeleneteket fed le. Ez az adathalmaz lehetővé teszi a modell hatékonyabb képzését és a teljesítmény mérését.
Kiemelkedő eredmények
Kiterjedt kísérletek kimutatták, hogy a WildShadowRemover módszere felülmúlja a létező megközelítéseket az árnyékeltávolítás minőségében és a temporális koherenciában. A modell időben koherens, árnyékmentes videókat állít elő, kiváló vizuális minőséggel, és erős általánosíthatóságot mutat a valós, kihívást jelentő forgatókönyvekben — írják a kutatók az arXiv-en.