Valós videókból futtatható fizikai szimulációkat generál a MirroS új AI-ja
A Code-as-World-VL-9B modell 55,4 MRA-t ért el a QuantiPhy-teszten, megelőzve a Gemini-3.1 Flash-t (54,8) és a legerősebb nyílt forráskódú alapmodellt.

A MirroS bemutatta a Code-as-World nevű paradigmát, amely fizikai világokat futtatható kódként reprezentál. A módszer lényege, hogy a videókban látott fizikai jeleneteket nem pixelekként, hanem szerkeszthető és újra szimulálható MuJoCo-kódként dolgozza fel. (MarkTechPost)
Az új megközelítés szerint a videók csak bizonyítékok egy fizikai jelenetre, nem maguk a jelenet ontológiái. Egy AI modell képes valósághű képkockákat előre jelezni anélkül, hogy megértené a tömeget, az ütközést vagy a gravitációt. A Code-as-World ezt orvosolja azzal, hogy futtatható kódot, egy úgynevezett scene.json fájlt hoz létre, amelyet a MuJoCo szimulátor képes futtatni.
Egy ötkörös ügynökhurok (agentic loop) segítségével a rendszer képes a valós videókból kinyerni és ellenőrizni ezeket a programokat. Az így igazolt világok pontos fizikai címkékkel ellátott képzési adatokká válnak, amelyek sokkal több információt hordoznak, mint a nyers videóanyag. Ezen felügyelet mellett betanított Code-as-World-VL-9B modell 55,4 MRA-t ért el a QuantiPhy-validáción, ami meghaladja a Gemini-3.1 Flash 54,8-as eredményét, és nagyjából 15 ponttal múlja felül a legerősebb nyílt forráskódú alapmodellt.
Fizikai világok kódként
A MirroS technikai jelentése szerint a videómodellek, a 3D rekonstrukció és a képaláírások mind részei egy jelenetnek, de egyik sem képes megragadni annak mechanizmusát. A Code-as-World ezt a hiányosságot pótolja azzal, hogy a jelenetet egy végrehajtható világreprezentációként (EWR) kezeli, amely magában foglalja az objektumok kompozícióját (geometria, méretek, tömeg, súrlódás, gravitáció), az evolúciót (kezdeti állapotok, erők, ütközések, időtartam) és a megjelenést (kamera, világítás, képkockasebesség). A kiadott implementációban ez a hármas egy scene.json fájlba fordítódik, amelyet a MuJoCo képes futtatni, akár animációs, akár fizikai motorral.
Ügynöki felfedezés és szimuláció
Az EWR videóból való kinyerése inverz problémaként jelenik meg, amit a csapat abduktív keresésként keretez. Egy ügynök hajt végre egy javaslat-példányosítás-végrehajtás-renderelés-ellenőrzés (propose → instantiate → execute → render → verify) ciklust, legfeljebb 5 körben.
A videóbemenethez a SAM 3 biztosítja az objektummaszkokat és a síkbeli követést, a VGGT-Omega becsli a mélységet és a kamera geometriáját, míg a SAM 3D objektumszintű hálókat generál. A jelölt kimeneteket összevetik a bemeneti nézettel, és a különbségek strukturált visszajelzést adnak a következő revízióhoz. A tesztek szerint ez a módszer felülmúlja a hagyományos mintavételi technikákat.
Elérhetőség és licenc
A Code-as-World-VL-4B és -VL-9B modellek, amelyeket a Qwen3.5 modellekből finomhangoltak, Apache 2.0 licenc alatt érhetők el. A modellek vLLM-en keresztül, OpenAI-kompatibilis API-ként futnak, 16 képkocka mintavételezéssel és 4608 token hosszúságú kontextussal. A rendszer jelenleg kutatási és belső prototípus szinten használható.