Új DART módszer mélységi előtanulással javítja a sebészeti képfeldolgozást
A DART módszer mélységi információt épít be a sebészeti AI-modellek betanításába, így azok nyolc teljesítményteszten is felülmúlják a hagyományos RGB-alapú modelleket.

A DART (Depth-as-Target) előtanulási recept a DINOv2 alapokon nyugszik, egy egyszerű módosítással: egy pixel-térbeli mélységrekonstrukciós célt ad a masked iBOT patchekhez, amit pszeudo-címkézett mélységi adatokkal tanítanak be. (ArXiv CV)
A DART csak az előtanítás során használja a mélységi adatokat, így a finomhangolás és az inferencia RGB-képekkel történik. A kutatás rávilágít, hogy a pixel-szintű rekonstrukciós fejlemény javítja a reprezentáció minőségét, nem pedig megzavarja azt.
Működési elv és geometriai előnyök
A mélység, amely a jelenlegi geometriát kódolja, hatékonyabb célnak bizonyult, mint más sűrű jelek, például a Canny-élek, ami megerősíti, hogy az előnyök a geometriai információból származnak, nem csupán a hozzáadott felügyeletből.
A DART módszer nyolc sebészeti teljesítményteszten, beleértve a szegmentációt, mélységbecslést és képfelismerést, felülmúlja mind a természetes képeken, mind a domain-specifikus alapmodelleket. Ez magában foglal egy ugyanolyan adathalmazon betanított, hagyományos DINOv2 modellt is.
Erőforrás-hatékonyság és elérhetőség
A DART megmutatja, hogy a szabadon elérhető geometriai pszeudo-címkék erősíthetik az alapmodellek előtanítását extra címkék vagy többlet inferencia költség nélkül. Az eredmények szerint a DART javítja a sűrű előrejelzéseket, miközben erősíti a kép-szintű megértést is.
A kutatás előnyomtatott formában érhető el az arXiv-on.