GPT-6 Astra 53%-os pontossággal épít 3D-jeleneteket, de a geometriát rosszul ítéli meg
Az új LEGO-Anything módszer fotókból futtatható Blender-programokat generál, de a 3D-jelenetek geometriai pontossága és az ügynökök önértékelése még problémás a kutatók szerint.

A LEGO-Anything projekt, amelyet az University of Maryland és az AWS kutatói dolgoztak ki, az „Image-to-Code” megközelítést használja. A végeredmény egy futtatható Blender-program, amely explicit módon rögzíti az objektumokat, geometriát, elrendezést és a kamera pozícióját, így a felhasználó szerkesztheti és lekérdezheti a jelenetet.
LEGO-Bench: Szintetikus adatok a pontos értékeléshez
A kutatók a LEGO-Bench nevű teljesítménytesztet is bevezették az ügynökök teljesítményének mérésére. Ez 208 képet tartalmaz 104 beltéri és kültéri jelenetből, 443 regisztrált elemmel. Mivel a valós fotók nem nyújtanak precíz 3D-alapigazságot, a LEGO-Bench professzionálisan épített szimulált jelenetek renderelésével hoz létre természetes megjelenésű bemeneteket, miközben a pontos geometriai és tárgyadatok válasz-kulcsként szolgálnak az automatizált pontozáshoz. A teljesítményteszt három tengelyen pontozza a jeleneteket: érvényesség, geometriai pontosság és vizuális hasonlóság az eredetihez.
A GPT-6 Astra a legjobb, de még mindig pontatlan
Az összes tesztelt GPT-konfiguráció szinte minden alkalommal működő jelenetet szállított, de a pontosság erősen változó volt. A GPT-6 Astra, a legjobb tesztelt modell, 53,4%-os pontosságot ért el beltéri jeleneteknél és 39,6%-ot kültéri jeleneteknél – közölte a The Decoder. Gyengébb konfigurációk körülbelül 15%-ot teljesítettek. A komplexebb jelenetek pontossága csökkent, és a kültéri jelenetek nehezebbek, mint a beltériek.
Az ügynökök nem tudják megítélni saját munkájukat
A kutatók elemezték az ügynökök munkalépéseit, és azt találták, hogy a leggyakoribb problémák közé tartoznak a gyenge kezdeti próbálkozások, a korábbi haladást visszavonó módosítások és a megbízhatatlan önértékelés. Még a GPT-6 Astra is képes volt lerontani a saját jelenetét a folyamat végén. Amikor a modelleknek két verzió közül kellett kiválasztaniuk, melyik hasonlít jobban az eredetihez, geometriai ítéleteik esélyszint körüli vagy alattiak voltak. Ez arra utal, hogy a finomítást konkrét mérésekre kell alapozni, nem az ügynök saját ítéletére.
A LEGO-Plugin javít a helyzeten
A LEGO-Plugin nevű bővítmény, amelyhez nincs szükség további betanításra, anchorsálja a kiinduló jelenetet a referenciaképhez, a megbízhatatlan önértékelést konkrét mérésekkel helyettesíti, és megvédi a helyes haladást a visszamenőleges szerkesztésektől. A plugin minden hat modell esetében javított a teljesítményen, a gyengébb ügynökök pedig akár 62,7%-os növekedést mutattak. A már erős topmodell csak mintegy két százalékponttal javult.
A 3D-jelenetek még nem elég pontosak a gyakorlati feladatokhoz
A generált jelenetek használhatók, de nem kiemelkedő eredményeket hoztak olyan feladatokban, mint az objektumdetektálás, szegmentálás és mélységbecslés. Az objektumdetektálás teljesített a legjobban, nagyjából feleakkora teljesítménnyel, mint a specializált DINO modell. A szegmentálás és mélységbecslés esetében a lemaradás nagyobb volt a SAM 3 és Depth Anything 3 modellekhez képest. A kutatók szerint bár a futtatható jelenetprogramok ígéretesek, még nem elég pontosak a hű rekonstrukcióhoz, különösen a SAM 3 és Depth Anything 3 modellekhez képesti lemaradás miatt.