Az AI-ügynökök 30%-ot sem érnek el a teszteken, új értékelőrendszert adtak ki
Az AI-ügynökök képességeit egységesebb és megbízhatóbb módon tesztelő rendszert adtak ki. A Harbor Adapters több mint 80 teljesítménytesztet integrál, míg a Harbor-Index 82 nehéz feladatot kínál.

Az arXiv kutatói a Harbor Adapters és a Harbor-Index bevezetésével kínálnak megoldást arra, hogy a rengeteg speciális környezetet és integrációt igénylő teljesítménytesztek miatt egyre nagyobb kihívást jelentő AI-ügynökök értékelése egységes infrastruktúrát és kurált adatkészletet kapjon a nagyméretű ügynökmodellek átfogó értékeléséhez. (ArXiv AI)
Egységes infrastruktúra és validálás
A Harbor Adapters egy olyan egységes értékelési infrastruktúra, amely több mint 80 agentic teljesítménytesztet képes kezelni. Ezeket az adaptereket kódellenőrzéssel és paritásos kísérletekkel validálták, hogy biztosítsák a megbízhatóságukat. A rendszer lehetővé teszi tetszőleges ügynökök tesztelését a különféle benchmarkokon, megkönnyítve ezzel a korábbiaknál szélesebb körű elemzést az ügynökök képességeiről és a hibamódokról.
Teljesítményeredmények és korlátok
A kutatók nagyszabású értékelést végeztek 8 különböző nyelvi modellügynökkel, 54 teljesítményteszten keresztül. Az eredmények szerint egyetlen modell-harness konfiguráció sem érte el a 30%-os sikeres teljesítési arányt. A legerősebbnek bizonyult modell, a GPT-5.5 Codexszel, 28,0%-os eredményt ért el.
A Harbor-Index feladatkészlete
A Harbor-Index egy gondosan összeállított, 82 nehéz és sokrétű feladatot tartalmazó adatkészlet. Ezeket 29 különböző benchmarkból szűrték ki nehézségi szűrés, AI és emberi audit, valamint egy audit-és-javító ciklus segítségével. A Harbor-Index célja, hogy megőrizze a nagyméretű agentic értékelések kihívását és szélességét, miközben futtatása költséghatékony marad.
Az adapterek, az értékelési eredmények, az elemzések és a Harbor-Index mind nyílt forráskódú artefaktumként kerülnek kiadásra a nyelvi modellügynökök megbízhatóbb és átfogóbb értékelési ökoszisztémájának támogatására.