AI robotika forradalma még várat magára, a fizikai világ kihívásai
Elon Musk szerint a Tesla Optimus 2027-re 20 ezer dollárért érhető el, emberi és szuperemberi ügyességgel. A Morgan Stanley 2050-ig egymilliárd humanoid robotot és 5 billió dolláros piacot jósol, de a kutatók szkeptikusak.

Elon Musk, a Tesla vezérigazgatója szerint a cég Optimus humanoid robotja „nem csupán a Tesla legnagyobb terméke lesz valaha, hanem valószínűleg minden idők legnagyobb terméke”. Musk azt jósolja, hogy a robotok 2027 végére már a nagyközönség számára is elérhetők lesznek, darabjuk mindössze 20 000 dollárba fog kerülni, és emberi, majd szuperemberi ügyességgel rendelkeznek majd. A Morgan Stanley előrejelzése szerint 2050-re közel 1 milliárd emberhez hasonló robot lesz a piacon, melynek értéke meghaladja az 5 billió dollárt. (MIT Technology Review)
Az OpenAI ChatGPT-jéhez hasonló AI-fejlődés teszi lehetővé a robotok új generációjának, hogy utánozzák az emberi mozgást, ahogy a chatbotok az emberi nyelvet. Sok robotikai kutató azonban szkeptikus, és úgy vélik, hogy a nyelven és képeken alapuló intelligencia nem elegendő a fizikai világ végtelen variabilitásának elsajátításához. „Egyik humanoid robotokat építő cégnek sem fogalma sincs, hogyan tegye elég okossá ezeket a robotokat ahhoz, hogy hasznosak legyenek” — nyilatkozta Yann LeCun, az AI egyik „keresztapja”.
Humanoidek és általános gépek különbsége
A kutatók arra is rámutatnak, hogy félrevezető összekeverni az emberi megjelenésű robotokat azokkal az általános gépekkel, amelyek képesek megtanulni és több feladatot elvégezni. „Nagyon könnyű egy embert utánzó robotot építeni” — magyarázza Jonathan Hurst, az Agility Robotics társalapítója. „Drámaian nehezebb olyan gépet készíteni, amely dinamikusan vagy fizikailag úgy mozog vagy viselkedik, mint egy ember.”
A DeepMind ALOHA 2 tesztjei
Ezek a feszültségek — hogy az univerzális humanoid robotok a sarkon vannak-e, vagy sehol sem láthatók, és hogy a jelenlegi AI-módszerek elegendőek-e a tökéletesítésükhöz — a robotikai laborokban zajlanak. A Google DeepMind ALOHA 2 rendszere, amely két karból, néhány markolófogóból és kamerákból áll, teszteli a legfejlettebb AI-robotikai rendszereket, mint a Gemini Robotics.
Az ALOHA 2 képes volt például egy ebédet összeállítani, ami jelentős előrelépés a három évvel ezelőtti állapothoz képest. Ez nagyrészt az AI-nak és a robotpolitikáknak köszönhető, amelyek szabályozzák, hogyan kell egy általános robotnak felmérnie környezetét, megterveznie mozgását és végrehajtania a feladatát.
Történelmileg ezek a politikák mérnöki szabályokon alapultak, amelyeket a robot szoftverébe kódoltak. Az elmúlt években a robotpolitikákat fejlett AI-rendszerekre bízzák. Először a látás-nyelv modellek (VLM-ek) jelentek meg, amelyek képeken és szavakon is edzettek. Ezt követték a látás-nyelv-akció (VLA) modellek, amelyek lehetővé teszik a robotoknak, hogy felmérjék környezetüket és cselekedjenek benne.
Ezek a modellek mozgáskomparátorok hozzáadásával teszik lehetővé a robotok számára, hogy megtanulják, hogyan kell parancsolni a robotnak a feladat végrehajtása során. Ezt a képzést általában teleoperáción keresztül gyűjtik, ahol egy ember távirányítóval vezeti a robotot egy akció végrehajtására.