ÉlőUtoljára: az iméntMa: 26
Kutatásfrissítve: 14:15

GPT-6 Astra 53%-os pontossággal épít 3D-jeleneteket, de a geometriát rosszul ítéli meg

Az új LEGO-Anything módszer fotókból futtatható Blender-programokat generál, de a 3D-jelenetek geometriai pontossága és az ügynökök önértékelése még problémás a kutatók szerint.

GPT-6 Astra 53%-os pontossággal épít 3D-jeleneteket, de a geometriát rosszul ítéli meg
Fotó: National Institute of Allergy and Infectious Diseases / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

A LEGO-Anything projekt, amelyet az University of Maryland és az AWS kutatói dolgoztak ki, az „Image-to-Code” megközelítést használja. A végeredmény egy futtatható Blender-program, amely explicit módon rögzíti az objektumokat, geometriát, elrendezést és a kamera pozícióját, így a felhasználó szerkesztheti és lekérdezheti a jelenetet.

LEGO-Bench: Szintetikus adatok a pontos értékeléshez

A kutatók a LEGO-Bench nevű teljesítménytesztet is bevezették az ügynökök teljesítményének mérésére. Ez 208 képet tartalmaz 104 beltéri és kültéri jelenetből, 443 regisztrált elemmel. Mivel a valós fotók nem nyújtanak precíz 3D-alapigazságot, a LEGO-Bench professzionálisan épített szimulált jelenetek renderelésével hoz létre természetes megjelenésű bemeneteket, miközben a pontos geometriai és tárgyadatok válasz-kulcsként szolgálnak az automatizált pontozáshoz. A teljesítményteszt három tengelyen pontozza a jeleneteket: érvényesség, geometriai pontosság és vizuális hasonlóság az eredetihez.

A GPT-6 Astra a legjobb, de még mindig pontatlan

Az összes tesztelt GPT-konfiguráció szinte minden alkalommal működő jelenetet szállított, de a pontosság erősen változó volt. A GPT-6 Astra, a legjobb tesztelt modell, 53,4%-os pontosságot ért el beltéri jeleneteknél és 39,6%-ot kültéri jeleneteknél – közölte a The Decoder. Gyengébb konfigurációk körülbelül 15%-ot teljesítettek. A komplexebb jelenetek pontossága csökkent, és a kültéri jelenetek nehezebbek, mint a beltériek.

Az ügynökök nem tudják megítélni saját munkájukat

A kutatók elemezték az ügynökök munkalépéseit, és azt találták, hogy a leggyakoribb problémák közé tartoznak a gyenge kezdeti próbálkozások, a korábbi haladást visszavonó módosítások és a megbízhatatlan önértékelés. Még a GPT-6 Astra is képes volt lerontani a saját jelenetét a folyamat végén. Amikor a modelleknek két verzió közül kellett kiválasztaniuk, melyik hasonlít jobban az eredetihez, geometriai ítéleteik esélyszint körüli vagy alattiak voltak. Ez arra utal, hogy a finomítást konkrét mérésekre kell alapozni, nem az ügynök saját ítéletére.

A LEGO-Plugin javít a helyzeten

A LEGO-Plugin nevű bővítmény, amelyhez nincs szükség további betanításra, anchorsálja a kiinduló jelenetet a referenciaképhez, a megbízhatatlan önértékelést konkrét mérésekkel helyettesíti, és megvédi a helyes haladást a visszamenőleges szerkesztésektől. A plugin minden hat modell esetében javított a teljesítményen, a gyengébb ügynökök pedig akár 62,7%-os növekedést mutattak. A már erős topmodell csak mintegy két százalékponttal javult.

A 3D-jelenetek még nem elég pontosak a gyakorlati feladatokhoz

A generált jelenetek használhatók, de nem kiemelkedő eredményeket hoztak olyan feladatokban, mint az objektumdetektálás, szegmentálás és mélységbecslés. Az objektumdetektálás teljesített a legjobban, nagyjából feleakkora teljesítménnyel, mint a specializált DINO modell. A szegmentálás és mélységbecslés esetében a lemaradás nagyobb volt a SAM 3 és Depth Anything 3 modellekhez képest. A kutatók szerint bár a futtatható jelenetprogramok ígéretesek, még nem elég pontosak a hű rekonstrukcióhoz, különösen a SAM 3 és Depth Anything 3 modellekhez képesti lemaradás miatt.

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom