Az NVIDIA Cosmos 3 Edge robotvezérlésre optimalizálva — valós idejű irányítás Jetson Thoron
Az NVIDIA új Cosmos 3 Edge modellje 1,5 másodpercenként generál akciókat, így a robotok folyamatosan mozoghatnak anélkül, hogy adatközponti GPU-ra lenne szükségük.

A robotoknak képeseknek kell lenniük szenzoraikhoz, környezetükhöz és feladataikhoz igazodni, miközben fedélzeti számítástechnikai hardveren futnak. A világmodellek alapot kínálnak a fizikai interakciók tanulásához, de méretük megnehezítheti a fedélzeti telepítést. Ez változik az új NVIDIA Cosmos 3 Edge modellel. (Nvidia Developer)
A Cosmos 3 Edge egy 4 milliárdos omni-modell (egy 2 milliárdos NVIDIA Nemotron-alapú okoskodóval), amely a Cosmos 3 család része. Ugyanazon fizikai világadatokon tanulták előre, mint az NVIDIA Cosmos 3 Nano és az NVIDIA Cosmos 3 Super, és ugyanazokkal az alapokkal rendelkezik a tárgyak mozgásának és kölcsönhatásának megértésében. Ráadásul a modell elég kicsi ahhoz, hogy az NVIDIA Jetson Thor fedélzeti számítógépén fusson.
Robotvezérlés fedélzeti AI-val
A világ alapmodelljeit nagy multimodális adathalmazokon tanítják elő, amelyek rögzítik a tárgyak mozgásának és fizikai kölcsönhatásainak mintáit. A Cosmos natívan generál akciókat fizikai megértés és predikciós képességek alapján. Ez az előzetes tudás hasznos kiindulópontot biztosít a robotpolitika-képzéshez, ahelyett, hogy a politikának minden fizikai kapcsolatot feladat-specifikus demonstrációkból kellene megtanulnia.
Ezeknek a modelleknek a fizikai robotokon történő telepítése azonban két gyakorlati korlátozást vezet be: az eszköz memóriája és a vezérlési késleltetés. A Cosmos 3 Edge utólagos képzése mindkét korlátozást kezeli. A keletkező politikai modell elfér a Jetson Thor memóriájában, így a következtetés közvetlenül a roboton fut, nem pedig egy adatközponti GPU-ra kerül át. A DROID akciópolitika valós időben fut, közvetlenül a roboton.
Egy NVIDIA Jetson AGX Thor T5000-en körülbelül 1,53 másodpercet generál minden akcióblokkra (640×540 felbontáson és 15 Hz-en futva), miközben egyetlen blokk nagyjából 2,13 másodpercnyi robotmozgást fed le. Mivel a következő blokk elkészül, mielőtt az aktuális befejeződne, a kar folyamatosan mozog, adatcenteri GPU nélkül. A politika támogatja a folyamatos streamelést fedélzeti módon, akcióblokkok generálásával és minden következtetési ciklus utáni újratervezéssel.
Teljesítmény és adatok
Zárt hurkú RoboLab feladatokban az utólag képzett politika 22,9%-os sikerrátát ér el. Ezek az eredmények azt mutatják, hogy egy 4 milliárdos világ alapmodell praktikus, valós idejű, fedélzeti politikai gerincoszlopként szolgálhat. Ez a modell elfér egy Jetson AGX Thoron, és teljes egészében a roboton fut.
A bemutatott politikai kiadás a nvidia/Cosmos3-DROID adatkészleten alapul. Ez 76 000 sikeres teleoperált trajektóriát, körülbelül 350 órát tartalmaz 86 feladaton és 564 jeleneten keresztül, Franka Panda karral és Robotiq fogóval gyűjtve. Az adatkészlet LeRobotDataset v3.0 formátumban, 640×360 felbontáson érhető el.
A képzéshez az adatkészletet három szakaszban kell előkészíteni: az üresjáratú és nem feladat-specifikus képkockák szűrése, a sikeres demonstrációk kiválasztása, valamint véletlenszerű kivágás, átméretezés és szín-jitter alkalmazása a képzés során.
A modell futtatásához az NVIDIA DGX Stationt GB200 Grace Blackwell Superchip-pel vagy GB300 Grace Blackwell Ultra Desktop Superchip-pel, valamint CUDA 13.0 és NGC 26.06-py3 verziókat kell használni. A képzéshez 64 csomópontnyi GB200 szükséges, körülbelül 68 órán keresztül.