ÉlőUtoljára: 7 perceMa: 15
Kutatásfrissítve: 11:16

Valós videókból futtatható fizikai szimulációkat generál a MirroS új AI-ja

A Code-as-World-VL-9B modell 55,4 MRA-t ért el a QuantiPhy-teszten, megelőzve a Gemini-3.1 Flash-t (54,8) és a legerősebb nyílt forráskódú alapmodellt.

Valós videókból futtatható fizikai szimulációkat generál a MirroS új AI-ja
Fotó: Logan Gutierrez / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A MirroS bemutatta a Code-as-World nevű paradigmát, amely fizikai világokat futtatható kódként reprezentál. A módszer lényege, hogy a videókban látott fizikai jeleneteket nem pixelekként, hanem szerkeszthető és újra szimulálható MuJoCo-kódként dolgozza fel. (MarkTechPost)

Az új megközelítés szerint a videók csak bizonyítékok egy fizikai jelenetre, nem maguk a jelenet ontológiái. Egy AI modell képes valósághű képkockákat előre jelezni anélkül, hogy megértené a tömeget, az ütközést vagy a gravitációt. A Code-as-World ezt orvosolja azzal, hogy futtatható kódot, egy úgynevezett scene.json fájlt hoz létre, amelyet a MuJoCo szimulátor képes futtatni.

Egy ötkörös ügynökhurok (agentic loop) segítségével a rendszer képes a valós videókból kinyerni és ellenőrizni ezeket a programokat. Az így igazolt világok pontos fizikai címkékkel ellátott képzési adatokká válnak, amelyek sokkal több információt hordoznak, mint a nyers videóanyag. Ezen felügyelet mellett betanított Code-as-World-VL-9B modell 55,4 MRA-t ért el a QuantiPhy-validáción, ami meghaladja a Gemini-3.1 Flash 54,8-as eredményét, és nagyjából 15 ponttal múlja felül a legerősebb nyílt forráskódú alapmodellt.

Fizikai világok kódként

A MirroS technikai jelentése szerint a videómodellek, a 3D rekonstrukció és a képaláírások mind részei egy jelenetnek, de egyik sem képes megragadni annak mechanizmusát. A Code-as-World ezt a hiányosságot pótolja azzal, hogy a jelenetet egy végrehajtható világreprezentációként (EWR) kezeli, amely magában foglalja az objektumok kompozícióját (geometria, méretek, tömeg, súrlódás, gravitáció), az evolúciót (kezdeti állapotok, erők, ütközések, időtartam) és a megjelenést (kamera, világítás, képkockasebesség). A kiadott implementációban ez a hármas egy scene.json fájlba fordítódik, amelyet a MuJoCo képes futtatni, akár animációs, akár fizikai motorral.

Ügynöki felfedezés és szimuláció

Az EWR videóból való kinyerése inverz problémaként jelenik meg, amit a csapat abduktív keresésként keretez. Egy ügynök hajt végre egy javaslat-példányosítás-végrehajtás-renderelés-ellenőrzés (propose → instantiate → execute → render → verify) ciklust, legfeljebb 5 körben.

A videóbemenethez a SAM 3 biztosítja az objektummaszkokat és a síkbeli követést, a VGGT-Omega becsli a mélységet és a kamera geometriáját, míg a SAM 3D objektumszintű hálókat generál. A jelölt kimeneteket összevetik a bemeneti nézettel, és a különbségek strukturált visszajelzést adnak a következő revízióhoz. A tesztek szerint ez a módszer felülmúlja a hagyományos mintavételi technikákat.

Elérhetőség és licenc

A Code-as-World-VL-4B és -VL-9B modellek, amelyeket a Qwen3.5 modellekből finomhangoltak, Apache 2.0 licenc alatt érhetők el. A modellek vLLM-en keresztül, OpenAI-kompatibilis API-ként futnak, 16 képkocka mintavételezéssel és 4608 token hosszúságú kontextussal. A rendszer jelenleg kutatási és belső prototípus szinten használható.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom