ÉlőUtoljára: 17 perceMa: 22
Robotika & CVfrissítve: 14:24

Több mint egymillió óra videón tanult robotmodellt mutatott be a Dyna Robotics

A Dyna-2 modell több mint 1 millió óra emberi videón lett tanítva, ami nagyjából 170 évnyi folyamatos ébrenlétnek felel meg. A robotok képzését eddig korlátozta a speciálisan címkézett adatok hiánya.

Több mint egymillió óra videón tanult robotmodellt mutatott be a Dyna Robotics
Fotó: Arseny Togulev / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A Dyna Robotics bemutatta a Dyna-2 világ-akciós modellt (WAM), amely robotmanipulációra alkalmas. A modellt több mint egymillió óra egocentrikus emberi videón tanították be, ami nagyjából 170 évnyi folyamatos ébrenlétnek felel meg. A kutatás egy skálatörvényt állapított meg az emberi adatokon, annak átvitelét robotadatokra, valamint bizonyítékot talált arra, hogy a videó-előrejelzés hajtja az átvitelt. (MarkTechPost)

A robotok tanulását eddig az akciókra címkézett adatok hiánya lassította, amelyeket teleoperációval kell előállítani. A Dyna-2 azt vizsgálja, hogy a hétköznapi emberi videók helyettesíthetik-e ezeket az adatokat. A kutatócsapat 1000-től 1 millió óráig terjedő adatlétrát épített, és mérte a skálázódást. Három fő eredményt azonosítottak: egy skálatörvényt az emberi adatokon, ennek első átvitelét eddig nem látott robotadatokra, és azt, hogy a videó-előrejelzés kulcsfontosságú az átvitel szempontjából.

Mire képes a Dyna-2?

A Dyna-2 egy világ-akciós modell, amely egyetlen generatív modellként jövőbeli videókat és akciókat képes előre jelezni, akár külön, akár együtt, egy videó-diffúziós gerincen. A modell architektúrája transzformerek keveréke. A videó és az akció külön tokenizálódik, és különálló DiT rétegkötegeket kapnak, amelyek egymásra figyelnek.

A propriocepció közvetlenül az akciótranszformátorba táplálkozik. A videó tokenek kauzális maszkolást használnak, míg az akció tokenek bidirekcionális önfigyelmet és kontextus videó tokenekre való figyelmet alkalmaznak. A videó tokenek a szövegre is figyelnek, de a szöveg közvetlenül nem befolyásolja az akció tokeneket. A képzés flow matchinggel történik.

Skálatörvények és eredmények

A Dyna Robotics pontosan 1000, 10 000, 100 000 és 1 000 000 órás, egymásba ágyazott adathalmazokat használt. A skálatörvény emberi adatokon 1 millió óráig érvényes: minden metrika monoton módon javul és teljesíti a hatványtörvényeket. Az adathalmaz növelésével az MSE 0,0691·D^-0,0184 (R²=0,919) értékre, míg a [email protected] 0,357·D^+0,0203 (R²=0,865) értékre javul.

Az adatlétra során a [email protected] 51%-kal, az MSE pedig 12%-kal nőtt. Ez a törvény átterjed a modell által korábban nem látott robotadatokra is: ugyanazokat a csekkpontokat 39 feladaton tesztelték két YAM platformon, és az akció MSE 0,306·D^-0,0713 (R²=0,884) lett. A csapat 10 000 és 100 000 óra között egy inflexiós pontot jelzett.

Az eredmények azt mutatják, hogy a videó-előrejelzés kulcsfontosságú a különböző testbe való általánosításban. A közös denoisolás 39 feladatból 39-en jobb volt, mint csak az akcióadatokkal végzett képzés. Az akciócímkézett adatok 50 000 órán tartásával és videó-csak órák hozzáadásával a nulla-lövéses robot MSE 0,340-ről 0,120-ra csökkent. Az emberi hibák nem javulnak, a videó előnye kifejezetten a testek közötti általánosításban rejlik.

Elérhetőség és iparági alkalmazások

A Dyna-2 jelenleg csak mint gyártó által üzemeltetett rendszer telepíthető, nem letölthető súlyokkal. A Dyna Robotics nem tett közzé nyilvános csekkpontot, API-t vagy licencet a modellhez. A telepítés jelenleg egy Dyna robotcell megvásárlását jelenti, nem a modell helyi futtatását.

A Dyna-1 robotok már működnek szállodákban, éttermekben és mosodákban, ami a középkategóriás szolgáltatókra és több telephelyes vállalkozásokra utal, amelyek ismétlődő, álló manipulációs munkát végeznek. Nem alkalmas egyéni fejlesztőknek vagy kutatólaboroknak, amelyek helyi következtetést szeretnének végezni. Az iparágak között szerepel a vendéglátás, a kereskedelmi mosoda, az élelmiszer-szolgáltatás, a könnyű összeszerelés és csomagolás, valamint a létesítmények tisztítása.

A 14 utólagos képzési feladat reális munkákhoz kapcsolódik, mint például a szemetes tálcák ürítése, elsősegély-készletek összeállítása, dobozok építése, ételek kanalazása, kötelek kötése, vállfák előkészítése és italok kivétele hűtőszekrényből. Az egyik H100-as GPU-n a videó mintavételezése 10 203 ms-ról 110 ms-ra csökkenthető egy desztillációs folyamattal.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom