Robotokat irányít a Google RT-2 mesterséges intelligenciája
A Google RT-2 modellje milliárdos paraméterekkel képes robotokat irányítani, új korszakot nyitva a robotika fejlődésében. A modell a valós idejű internetes tudást is felhasználja, és jelentős előrelépést mutat az általánosításban.

A robotika világa egy új „GPT-3 pillanaton” megy keresztül, mióta a Google 2023 júliusában bemutatta az RT-2 modellt. Ez a multimodális nagy nyelvi modell (LLM) képes közvetlenül robotmozgásokat generálni, ami forradalmasítja az iparágat. Az RT-2 nem az első ilyen jellegű modell a Google-tól, de milliárdos paraméterei és a webes adatokból örökölt képességei messze felülmúlják elődeit. (Understanding AI)
Paraméterek és általánosítási képességek
Az RT-1 modell 35 millió paraméterével szemben az RT-2 már milliárdos nagyságrendű paramétert tartalmaz. Ez a méretbeli ugrás jelentős javulást eredményezett az objektumok, jelenetek és utasítások általánosításában. A modell képes volt például egy kóla dobozt egy Taylor Swift képéhez mozgatni, miután az internetről megtanulta, ki kicsoda. Ez a képesség, amit a csapat „hatalmas, hatalmas izgalommal” írt le, azt mutatja, hogy az LLM-ekbe beágyazott tudás hogyan kapcsolható össze valós robotmozgásokkal.
Infrastruktúra és adatszerzés
A Google által bevezetett „vision-language-action” (VLA) koncepció és az RT-2 modell gyorsan iparági standarddá vált. Azonban az RT-2 sem volt tökéletes, és az elmúlt három évben az iparág ezen hiányosságok orvoslásán dolgozott. Az RT-2 áttörése robbanásszerű fejlődést indított el a robotikában, rengeteg amerikai és kínai startupot és nagyvállalatot ösztönözve hasonló architektúrákba való befektetésre.
A Google már 2017-ben feltalálta a transzformer architektúrát, és régóta kísérletezett LLM-ekkel és robotokkal. A PaLM-E, egy 12 milliárd paraméteres modell, amely a robotokhoz lett optimalizálva, már képes volt képeket és szöveget is feldolgozni, de nem tudta közvetlenül irányítani a robotokat a korlátozott fedélzeti számítási kapacitás miatt. Az RT-2 csapata ezt a korlátot úgy hidalta át, hogy a modellt egy Google adatközpontban futtatta, és hálózaton keresztül küldte az utasításokat a robotoknak.
Az RT-2 képessé tétele érdekében a Google három tesztkonyhát hozott létre és 13 robotot vásárolt. Emberi kezelők 17 hónap alatt több mint 130 000 alkalommal irányították távolról a robotokat, hogy tárgyakat mozgassanak, fiókokat nyissanak és helyezzenek be. Ez az adathalmaz tette lehetővé, hogy az RT-2 még soha nem látott objektumokat manipuláljon, új környezetekben működjön, és a feladatokhoz nem szükséges „zavaró tárgyakkal” teli pultokon is teljesítsen.
Az RT-2 áttörése után Karol Hausman, a Google RT-2 csapatának tagja, úgy döntött, hogy egy új szervezetben kell tovább fejleszteni a fizikai intelligencia kutatását. Hausman vezetésével megalakult a Physical Intelligence startup, amelyhez további négy Google-os és két külsős szakember csatlakozott.