ÉlőUtoljára: 8 perceMa: 0
Kutatásfrissítve: 23:15

Robotokat tanít a Cosmos 3-mal az NVIDIA, kevesebb adattal is tanulnak

Az NVIDIA Cosmos 3 modellje a fizikai világ dinamikáját modellezi, így a robotok kevesebb adattal tanulnak és jobban általánosítanak új feladatokra.

Robotokat tanít a Cosmos 3-mal az NVIDIA, kevesebb adattal is tanulnak
Fotó: Brecht Corbeel / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

A robotok képességeinek fejlesztése új szakaszba lépett: az NVIDIA Cosmos 3 modellje a hagyományos látás-nyelv-akció (VLA) megközelítések helyett világmodellekre (WAM) épít. Ez erősebb fizikai általánosítást tesz lehetővé, így a robotok új feladatokra, robotokra és környezetekre is át tudják vinni tudásukat, mindezt a tanult dinamikák kiaknázásával, nem csupán szemantikai leképezésekkel. A kutatók szerint ez a megközelítés leváltja a korábbi VLA-modelleket. (Nvidia Developer)

A robotok egyik legnagyobb kihívása, hogy a betanított mintákon túl is képesek legyenek általánosítani. Egy olyan robotpolitika, amely egy betanítási helyzetben sikeres, gyakran kudarcot vall, ha megváltoznak az objektumok alakjai, pozíciói vagy a megvilágítás. Az ilyen új körülményekhez való alkalmazkodás megköveteli, hogy a robotpolitika ne csak a bemutatókat utánozza, hanem megértse a feladat mögötti fizikai törvényszerűségeket. A hagyományos VLA-modellekhez egy előre betanított látás-nyelv modellhez (VLM) adnak egy akciómodult, ami azonban a világ leírására, nem pedig annak fejlődésének előrejelzésére optimalizált. A hiányzó dinamikai modell pontosan az, ami egy robotnak kell, amikor egy feladat a jelenet változásának előrejelzését igényli.

Ezt a problémát küszöböli ki a WAM megközelítés, amely a nyelvi háttérmodell helyett egy videóvilágmodellt használ. Mivel ez a modell modellezi a világ fejlődését, az utólagos betanításnak nem kell a dinamikát a nulláról tanítania, hanem egy már fizikai előzményekkel rendelkező modellt specializál. Az NVIDIA kutatási publikációja, a „World Action Models are Zero-shot Policies” kimutatja, hogy a videó és az akció együttes előrejelzése olyan tulajdonságokat ad a politikának, amelyeket egy VLA nehezen szerezhet meg. A WAM-ok a következőkben különböznek:

  • Tanulás változatos adatokból: Míg egy VLA a nyelvi utasításokat a pályákhoz rendeli, és gyakran szinte azonos demonstrációkat igényel ugyanazon feladathoz, egy WAM megtanulja a fizikai törvényeket – hogyan mozognak az objektumok, ha őket tolják, megfogják vagy elengedik. Bármilyen interakciós adat tanít valamit neki. Egy változatos adathalmaz, amely egy VLA számára elvesztegetett lenne, itt képzési jelzéssé válik, és az adatgyűjtés olcsóbbá válik.
  • Általánosítás a valós világban: A fizika általánosabb, mint a szemantika. Ahogy egy tárgy esik vagy csúszik, nem változik az objektummal, így a dinamikát megtanult modell ezt a tudást olyan jelenetekre és mozgásokra is át tudja vinni, amelyekre soha nem képezték.
  • Alkalmazkodás új robotokhoz kevés demonstrációval: Egy olyan modell, amely már megérti a fizikai interakciót, sokkal kevesebb feladatspecifikus adatra szorul, hogy egy új karhoz vagy fogóhoz specializálódjon.

Ezek a tulajdonságok az előzetes betanítási háttérmodellből fakadnak, így minden utólag betanított politikában megjelennek. Az NVIDIA Cosmos 3 modellje kiváló alapként szolgál ehhez. Ez egy omni-modell világ alapmodell, amely egy Mixture-of‑Transformers (MoT) architektúrára épül. Multimodális bemenetei egy autoregresszív transzformeren haladnak át, amely diszkrét tokeneket, például szöveget generál. Ez egy diffúziós transzformert irányít a folyamatos modalitásokhoz, beleértve a képet, videót, hangot és akciót. A szöveg következő token dekódolásával generálódik; minden más, beleértve az akciókat is, iteratív zajcsökkentéssel szintetizálódik. Ez egyetlen modellben egyesíti ezeket a modalitásokat, miközben megtartja az egyes részekhez leginkább illeszkedő generációs mechanizmust.

A Cosmos 3 három méretben érhető el: 4 milliárdos NVIDIA Cosmos Edge, 16 milliárdos NVIDIA Cosmos Nano és 64 milliárdos NVIDIA Cosmos 3 Super. A Cosmos 3 erős alapját a fizikai világra vonatkozó adatok szélessége adja. Az adathalmaz mintegy 767 millió képet, 348 millió valós világdinamikát bemutató videót, valamint 8 millió akciómintát tartalmaz, amelyek robotmanipulációt, autonóm vezetést, kamera- és egocentrikus mozgást ölelnek fel. Az adatok széleskörűsége lehetővé teszi, hogy a modell mélyrehatóan megértse a fizikai kölcsönhatásokat.

A Cosmos 3 a specializáció kiindulópontja. A Cosmos3-Nano-Policy-DROID egy 16 milliárdos paraméterű politika, amelyet a Cosmos 3 Nanóból tanítottak utólag a DROID platformhoz, amely egy Franka Panda karból és egy Robotiq fogóból áll. Egy 4 milliárdos verzió, a Cosmos3-Edge-Policy-DROID, ugyanígy utólag tanított, és használható eszközre történő telepítésre. Nyelvi utasítás és többkamerás megfigyelések alapján robotakció-trajektóriákat generál. Három tulajdonság következik az omni alapból: Képzelődik, miközben cselekszik. Amikor a modell akciókat ad ki, videót is tud generálni: hogy mit látna a robot kamerája, ha ezeket az akciókat végrehajtanák. Az akció és az előre jelzett kimenet ugyanabból a modellből, egyszerre származik. Megtartja a teljes omni architektúrát. Az utólagos betanítás semmit sem távolít el. A politika ellenőrzőpontja továbbra is tud érvelni és videót generálni, nem csak ízületi pozíciókat kiadni.

A Cosmos 3 használata csökkenti a különböző robottestekhez való alkalmazkodáshoz szükséges feladatspecifikus adatok mennyiségét. A Cosmos 3 technikai jelentése két, azonos recepttel, adattal és számítási kapacitással betanított DROID politikát hasonlít össze. Az egyik az alap ellenőrzőpontból indult, míg a másik egy több domain akcióadatokon betanított omni ellenőrzőpontból. Az omni ellenőrzőpont a RoboLab sikerrátáját 28,1%-ról 36,8%-ra növelte. Ez egyértelmű bizonyíték arra, hogy a javulás az architektúrából fakad, nem csak a méretből. A WAM-ok teljes generatív világmodellt hordoznak, nem csak egy akciófejet. Nagyobbak, mint a kompakt VLA-k, de a Cosmos 3 különböző telepítési szintekre képezhető le, szemben a hagyományos, csak munkaállomásokon futtatható modellekkel. A Cosmos 3 képes nagy átbocsátóképességű munkaállomásoktól kezdve valós idejű, eszközön belüli következtetésig futni NVIDIA Jetson hardveren, miközben mérhető javulást mutat a politika teljesítményében.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom