ÉlőUtoljára: 1 órájaMa: 10
Kutatásfrissítve: 10:15

Az AI-ügynökök 30%-ot sem érnek el a teszteken, új értékelőrendszert adtak ki

Az AI-ügynökök képességeit egységesebb és megbízhatóbb módon tesztelő rendszert adtak ki. A Harbor Adapters több mint 80 teljesítménytesztet integrál, míg a Harbor-Index 82 nehéz feladatot kínál.

Az AI-ügynökök 30%-ot sem érnek el a teszteken, új értékelőrendszert adtak ki
Fotó: National Institute of Allergy and Infectious Diseases / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

Az arXiv kutatói a Harbor Adapters és a Harbor-Index bevezetésével kínálnak megoldást arra, hogy a rengeteg speciális környezetet és integrációt igénylő teljesítménytesztek miatt egyre nagyobb kihívást jelentő AI-ügynökök értékelése egységes infrastruktúrát és kurált adatkészletet kapjon a nagyméretű ügynökmodellek átfogó értékeléséhez. (ArXiv AI)

Egységes infrastruktúra és validálás

A Harbor Adapters egy olyan egységes értékelési infrastruktúra, amely több mint 80 agentic teljesítménytesztet képes kezelni. Ezeket az adaptereket kódellenőrzéssel és paritásos kísérletekkel validálták, hogy biztosítsák a megbízhatóságukat. A rendszer lehetővé teszi tetszőleges ügynökök tesztelését a különféle benchmarkokon, megkönnyítve ezzel a korábbiaknál szélesebb körű elemzést az ügynökök képességeiről és a hibamódokról.

Teljesítményeredmények és korlátok

A kutatók nagyszabású értékelést végeztek 8 különböző nyelvi modellügynökkel, 54 teljesítményteszten keresztül. Az eredmények szerint egyetlen modell-harness konfiguráció sem érte el a 30%-os sikeres teljesítési arányt. A legerősebbnek bizonyult modell, a GPT-5.5 Codexszel, 28,0%-os eredményt ért el.

A Harbor-Index feladatkészlete

A Harbor-Index egy gondosan összeállított, 82 nehéz és sokrétű feladatot tartalmazó adatkészlet. Ezeket 29 különböző benchmarkból szűrték ki nehézségi szűrés, AI és emberi audit, valamint egy audit-és-javító ciklus segítségével. A Harbor-Index célja, hogy megőrizze a nagyméretű agentic értékelések kihívását és szélességét, miközben futtatása költséghatékony marad.

Az adapterek, az értékelési eredmények, az elemzések és a Harbor-Index mind nyílt forráskódú artefaktumként kerülnek kiadásra a nyelvi modellügynökök megbízhatóbb és átfogóbb értékelési ökoszisztémájának támogatására.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom