Térbeli érvelésben verte az élvonalat az NVIDIA új, edzésmentes AI-ügynöke
Az NVIDIA SpatialClaw ügynöke kódként kezeli az utasításokat, és 59,9%-os átlagos pontossággal teljesít 20 teljesítményteszten, felülmúlva a korábbi modelleket.

Az NVIDIA bemutatta a SpatialClaw nevű, edzésmentes AI-ügynököt, amely a 3D-s térbeli érvelésben jelenthet áttörést. A modell a kódolást használja az utasítások végrehajtására, megkerülve a látás-nyelvi modellek (VLM) egyik fő gyengeségét: a tárgyak helyének, viszonyának és mozgásának pontos megítélését 3D-ben.
A kutatók szerint a probléma nem magában a modellben, hanem az általa használt interfészben rejlik. A SpatialClaw ezt úgy orvosolja, hogy a kódot teszi meg az elsődleges parancsvégrehajtási felületté. A rendszer 20 különböző teljesítményteszten 59,9%-os átlagos pontosságot ért el, ami 11,2 pontos javulást jelent a korábbi, SpaceTools nevű ügynökhöz képest — írja a MarkTechPost.
Kapcsolódó: agentic scaffolding hiánya robotvezérlésben
A kód mint parancsvégrehajtási felület
A SpatialClaw egy Python kernelt használ, amely előre betöltött bemeneti képkockákkal és primitív függvényekkel rendelkezik. A percepciós eszközök egyszerű Python függvények, kimeneteik pedig — mint a maszkok, mélységtérképek vagy trajektóriák — standard Python változókként jelennek meg. A kernel hat nyilvános belépési pontot kínál, beleértve a `InputImages`-t a képkockákhoz, a `Metadata`-t a képkocka sebességéhez és a `tools`-t a percepciós és geometriai primitívekhez. Két kulcsfontosságú eszköz a `Depth Anything 3` által támogatott `Reconstruct`, amely mélységtérképeket és kamerageometriát ad vissza, valamint a `SAM 3` által támogatott `SAM3`, ami képi vagy videó maszkokat generál.
Kapcsolódó: lokális AI-ügynökök felhővel szemben
Az interfész szerepe a térbeli érvelésben
A kutatók három különböző parancsvégrehajtási interfészt vizsgáltak meg. A hagyományos, egylépéses kódírásban a modell egy teljes programot futtat le, mielőtt látná a köztes eredményeket, ami hibás feltételezésekhez vezethet. A strukturált eszközmeghívás egy rögzített JSON sémán keresztül hívja meg az eszközöket, de nem teszi lehetővé a kimenetek szabad kombinálását. Ezzel szemben a SpatialClaw kódkompozíciót használ: először kiszámítja a középpontok távolságát, majd észreveszi, hogy a nem pontos, és átvált a `scipy.spatial.KDTree` használatára a valós legközelebbi pont megtalálásához. Ez a rugalmasság vezetett a 0,9439 méteres eredményhez a 0,9 méteres valósághoz képest.
Kapcsolódó: térbeli intelligencia mérése nagyméretű modelleknél
Teljesítmény a benchmarkokon
A SpatialClaw-t 20 teljesítményteszten tesztelték, öt kategóriában, beleértve az egyszemélyes, többnézetes, általános, videó és 4D, valamint általános videóértékelést. A rendszer minden hat vizsgált háttérmodellen — 26 milliárd és 397 milliárd paraméter között, mint a Qwen3.5/3.6 és Gemma4 családok — javulást mutatott a szerszámok nélküli alapvonalhoz képest. A Gemma4-31B háttérmodellen a SpatialClaw 59,9%-os átlagos pontosságot ért el, ami 11,2 pontos előnyt jelent a SpaceTools-Toolshed (strukturált eszközmeghívás) módszerrel szemben. A legnagyobb nyereséget a dinamikus, több képkockán és nézőponton átívelő számításokat igénylő feladatoknál tapasztalták, mint a DSI-Bench (+17,6 pont) és a MindCube (+15,3 pont).
Kapcsolódó: robotok mély térbeli tudása kérdésekben
Az ötlépéses ciklus és a jövő
Minden minta egy ötlépéses ciklusban fut: tervezés, kódgenerálás, kódvégrehajtás, visszajelzés összeállítása és válaszbeküldés. A rendszer egy statikus AST ellenőrzővel szűri a nem biztonságos kódokat, mielőtt azok végrehajtódnának. A fejlesztők a GitHubon elérhető `SpatialClaw` repozitóriumban találnak példákat a gyorsindításhoz és a háttérmodellek integrálásához. Az NVIDIA szerint a SpatialClaw alkalmas olyan feladatokra, mint a robotika, többnézetes ellenőrzés, videó- és 4D-elemzés, valamint beltéri helyszínekkel kapcsolatos kérdések megválaszolása, és új adatok vagy finomhangolás nélkül bővíthető.
Kapcsolódó: AI-ügynökök tanulása hibákból