A CADSmith 100%-os végrehajtási sebességet ér el a CAD-modell generálásban
Jesse Barkley és munkatársai által kifejlesztett CADSmith 100 százalékos végrehajtási sebességet ért el

Jesse Barkley és kollégái a CADSmith nevű új rendszert mutatták be, amely 100 % -os végrehajtási sebességet ér el 100 feladatból álló, három nehézség‑csoportot (T1–T3) tartalmazó saját benchmarkon. A rendszer a természetes nyelvi leírásokból CadQuery kódot generál, majd két egymásba ágyazott visszacsatolási hurkot használ a hibák javítására. (ArXiv AI)
A CADSmith öt, egymástól független ügynökből áll: Planner, Coder, Executor, Validator és Refiner. Az inner loop a kód végrehajtási hibáit (pl. szintaktikai vagy futásidejű hibákat) a Refiner segítségével orvosolja, míg az outer loop programmatikus geometriális ellenőrzést végez az OpenCASCADE kernelből származó pontos mérésekkel – például határhólyagméretek, térfogat és szilárdság – valamint egy független vision‑language modellel, a Judge-nel végzett vizuális értékeléssel.
Az iteratív finomhangolás jelentősen javítja a modell minőségét: a median F1 pontszám 0,9707-ről 0,9846-ra nő, a median IoU 0,8085-ről 0,9629-re emelkedik, míg a mean Chamfer Distance 28,37-ről csökken 0,74-re. Ezek a számok azt mutatják, hogy a programmatikus visszacsatolás képes a dimenziós hibák felszínre hozására, amelyet a hagyományos vizuális visszajelzés nem tudott megoldani.
A rendszer a retrieval‑augmented generation megközelítést alkalmazja, így a CAD könyvtár fejlődésével együtt frissülhet anélkül, hogy fine‑tuningra lenne szükség. Ez biztosítja, hogy a legfrissebb API dokumentációt használja, miközben a kód generálás során a legújabb geometriai szabályokhoz igazodik.
A kutatók szerint a CADSmith demonstrálja, hogy a zárt hurkú, programmatikus ellenőrzés alapú megközelítés nemcsak a végrehajtási arányt növeli, hanem a generált modellek pontosságát is jelentősen javítja. A következő lépésben a csapat a rendszer skálázhatóságát és a valós idejű integrációt teszteli, miközben a benchmarkot 200 promptot tartalmazó, szélesebb spektrumú tesztelésre bővítik. A kutatók 2026. június végéig tervezik a nyílt forráskódú implementáció megjelentetését.