AI-kódoló ügynökök kevesebb mint 10%-os sikerességgel modernizálják a Java-alkalmazásokat
Az IBM Research által fejlesztett ScarfBench teljesítményteszt szerint a legfejlettebb AI-kódoló ügynökök is kevesebb mint 10%-os sikerességgel tudják átalakítani a Java-alkalmazásokat új keretrendszerekre, miközben megőrzik azok működését.

A vállalati alkalmazások modernizálása óriási költségekkel járó feladat, amely során a csapatok gyakran váltanak keretrendszert a karbantarthatóság, a felhőre való felkészültség és a fejlesztői termelékenység javítása érdekében. Az AI-kódoló ügynökök fejlődése izgalmat keltett az AI-asszisztált modernizáció terén, de továbbra is kérdéses, hogy ezek az eszközök megbízhatóan képesek-e valós vállalati alkalmazásokat átalakítani. A hagyományos szoftverfejlesztési teljesítménytesztek, amelyek hibajavításra és kódgenerálásra fókuszálnak, nem fedik le a keretrendszer-migráció kihívásait, amely nemcsak a kód fordítását, hanem a viselkedés megőrzését, a build-rendszerek adaptálását és a futásidejű függőségek kezelését is igényli. Ezt a hiányt pótolja a ScarfBench (Self-Contained Application Refactoring teljesítményteszt), egy nyílt teljesítményteszt az AI-ügynökök értékelésére vállalati Java cross-framework migrációs feladatokon — írja az IBM Research Blog.
ScarfBench felépítése és célja
A ScarfBench három fő Java ökoszisztéma — Spring, Jakarta EE és Quarkus — közötti migrációkra összpontosít. A teljesítményteszt nem csupán a generált kód referenciamegoldásokkal való összehasonlítására helyezi a hangsúlyt, hanem arra, hogy a migrált alkalmazások sikeresen lefordítódjanak, települjenek és megőrizzék eredeti viselkedésüket. Ez a megközelítés valósághűbb képet ad a modernizáció minőségéről. A ScarfBench 34 alkalmazást, 102 keretrendszer-implementációt és 204 migrációs feladatot foglal magában, mintegy 151 ezer kódsorral és több mint 1300 szakértő által írt teszttel. A migrációs folyamat során a rendszer ellenőrzi a sikeres fordítást, a helyes telepítést és a viselkedésbeli validációt.
Kapcsolódó: AI benchmark hibák
Az AI-ügynökök teljesítménye a migrációban
A legfejlettebb AI-kódoló ügynökök értékelése során a ScarfBench kimutatta, hogy a keretrendszer-migráció továbbra is jelentős kihívást jelent. A sikerráták jelentősen eltérnek a különböző keretrendszerpárok és a teljes alkalmazásokat érintő migrációk esetében, utóbbi különösen nehéznek bizonyult. Még a legerősebb ügynökök is kevesebb mint 10%-os viselkedésbeli sikerrátát értek el, ami rávilágít arra a szakadékra, ami a fordítható kód generálása és az alkalmazás viselkedésének megőrzése között tátong. A fordítási sikeresség következetesen meghaladja a telepítési sikerrátát, amely pedig a viselkedésbeli sikerrátát. Csak a fordítási sikeresség önmagában jelentősen túlbecsüli a migráció minőségét. A migráció nehézsége erősen függ a célkeretrendszertől, a Jakarta EE pedig különösen problémásnak bizonyult.
Kapcsolódó: SWE-bench ellenőrzés
Független validáció és iteratív folyamat
A ScarfBench azt is vizsgálta, hogy az AI-ügynökök mennyire megbízhatóan képesek jelezni a migráció befejezését. Claude Code például 30-ból 29 egész alkalmazás migrációját sikeresnek jelentette, holott közülük csak 22 épült fel ténylegesen. Ez arra utal, hogy az ügynökök önértékelése nem tekinthető megbízható jelnek, és a független fordítási és tesztelési validáció továbbra is elengedhetetlen. A migrációs folyamat nem lineáris, hanem iteratív. Az ügynökök gyakran tértek vissza a konfigurációs fájlokhoz, miközben a függőségeket és a futásidejű környezeti problémákat — mint a Docker cache-problémák vagy a portkapcsolódási hibák — próbálták orvosolni. A leggyakrabban érintett rétegek a konfiguráció, a webes komponensek, az adatbázisok és a szolgáltatások voltak, ami arra utal, hogy a migráció egy iteratív, függőségeket feloldó folyamat.
Kapcsolódó: AI-ügynökök szabályozása
A legnagyobb kihívás nem a kód, hanem a környezet
A legfontosabb tanulság, hogy a keretrendszer-modernizáció legnagyobb kihívása nem a Java kód fordítása, hanem a konfiguráció, az infrastruktúra és a futásidejű környezetek közötti függőségi háló kezelése. Bár a legfejlettebb AI-ügynökök automatizálni tudják a migrációs folyamat jelentős részét, a megbízható validáció és az architektúrális érvelés továbbra is kritikus a sikeres kimenetelhez. A ScarfBench célja, hogy szabványosított módszert kínáljon a fejlődés mérésére az autonóm alkalmazásmodernizáció terén. Az IBM Research nyílt forráskódúvá tette a ScarfBench-et, amelyhez a GitHubon, Hugging Face-en és egy dedikált weboldalon érhetőek el az adatkészletek, az értékelési infrastruktúra és a dokumentáció. A kutatók és a gyakorlati szakemberek a teljesítményteszt segítségével értékelhetik a modernizációs megoldásokat a termelési környezetben való bevezetésük előtt.
Kapcsolódó: Anchor rendszer bemutatása