Az Ant Group új LingBot-Vision modellje 7-szer kisebb, mégis jobb sűrű térbeli feladatokban
Az Ant Group 1,1 milliárd paraméteres LingBot-Vision modellje 7-szer kisebb a DINOv3-nál, de jobb eredményeket ér el sűrű térbeli feladatokban, miközben kevesebb mint harmadannyi képből tanult.

Az Ant Group bemutatta a LingBot-Vision modellt, amely a robotok számára kritikus sűrű térbeli információkra fókuszál. A modell a hagyományos szemantikai invarianciát felcserélve a határokat, kontúrokat és mélységi ugrásokat helyezi előtérbe. A 1,1 milliárd paraméteres ViT-giant modell teljesítménye a gyártó szerint eléri vagy meghaladja a nála 7-szer nagyobb modellekét, beleértve a DINOv3-at is — írja a MarkTechPost.
A LingBot-Vision egy önszupervizált előbetanított encoder, amelyet kifejezetten térbeli feladatokra terveztek. A ViT-g/16 modell 1,1 milliárd paraméterrel rendelkezik, és az új masked boundary modeling (MBM) eljárással tanulták mintegy 161 millió képen. A képanyagot egy 2 milliárdos webes adatbázisból válogatták, emberi címkék vagy külső élérzékelők nélkül. A képzés gazdaságossága kiemelkedő: a DINOv3-hoz képest az adatbázis nagyságrendekkel kisebb, és kevesebb mint harmadannyi képkockát használtak fel a betanításhoz.
Kapcsolódó: Qwen3.6-35B-A3B kódoló ügynök
Hatékonyabb robotlátás a határok hangsúlyozásával
A masked boundary modeling lényege, hogy a modell nemcsak a képek tartalmát, hanem az objektumok határait is kiemelten kezeli. A DINO/iBOT önszupervizált megközelítését továbbfejlesztve, a teacher-modell online módon generálja a határokat tartalmazó célmezőket, amelyeket a student-modellnek kell helyreállítania. A hagyományos masked image modeling véletlenszerűen takar ki képpontokat, figyelmen kívül hagyva a határok mentén rejlő strukturális információt. A LingBot-Vision ezt a hiányosságot két ötlettel küszöböli ki: a boundary-forcinggal, amely a véletlenszerű maszkoláson túl a határokat is célként jelöli meg, és a categorical boundary fielddel, amely a határokat diszkrét mezőkké alakítja át, megkönnyítve a predikciót.
Kapcsolódó: GLM-5V-Turbo nagy kontextussal
Kiemelkedő eredmények sűrű térbeli feladatokban
A teljesítménytesztek szerint a LingBot-Vision kiemelkedő eredményeket mutat sűrű térbeli feladatokban. A NYU-Depth v2 adathalmazon 0,296-os RMSE-t ért el, ami jobb a 7 milliárd paraméteres DINOv3 0,309-es eredményénél, miközben a paraméterek száma 7-szer kisebb. A KITTI adathalmazon a 2 milliárd paraméter alatti modellek között a legjobb. A szemantikai szegmentációnál az ADE20K-n 1,3 mIoU-val marad el a DINOv3-tól, de a Cityscapes-en megegyezik vele, és a VOC12-n jobb. A DINOv2-höz képest 4+ mIoU-s javulást mutat mindhárom teljesítményteszten.
Kapcsolódó: DreamHouse látás-nyelv benchmark
A modellből lecsupaszított, kisebb diák modellek, mint a ViT-L (300M) és ViT-B (86M), méretosztályukon belül vezetik a sűrű predikciós feladatokat. A ViT-L diák modell 0,310-es RMSE-t ér el a NYUv2-n, ami szinte megegyezik a 7 milliárdos DINOv3 eredményével, miközben 23-szor kevesebb paramétert használ.
Kapcsolódó: Meta AI Sapiens2 pózbecslés
Felhasználási területek és elérhetőség
A LingBot-Vision fagyasztott patch tokenjei közvetlenül használhatók különféle sűrű feladatokhoz, mint például mélységbecslés, szemantikai szegmentálás és videó objektumok szegmentálása. A modell inicializálására is alkalmas downstream depth-completion feladatokhoz. A súlyok Apache-2.0 licenc alatt érhetők el a Hugging Face-en, négy méretben: ViT-giant, ViT-large, ViT-base és ViT-small.
Kapcsolódó: Wan-Image képgenerálás