Új nyílt teljesítménytesztet indított a GitHub az AI kódbeszélő ügynökök mérésére
A GitHub új, nyílt benchmarkja, a ReviewBench, valós kódkérésmintákon teszteli az AI kódértékelő ügynököket, 19 programozási nyelven.

A ReviewBench 219 nyilvános kódkérésen alapul, 19 programozási nyelven, és a GitHub több mint 100 millió valós kódkérésének mintázatait követi a nyelv, a tároló mérete és a változás alakja tekintetében. (GitHub Blog)
Adathalmaz és módszertan
A teljesítményteszt több forrásból származó „golden set”-et használ, beleértve emberi felülvizsgálókat, fejlett LLM-eket és statikus elemzési eszközöket. Minden talált hibát súlyosság és kategória szerint címkéznek, ami lehetővé teszi a felhasználó-specifikus szeleteket.
Értékelési mutatók és hitelesség
A négy értékelési metrika – a grounded precision, grounded recall, augmented precision és augmented recall – segít objektíven összehasonlítani a különböző kódértékelő rendszereket. A ReviewBench megbízhatóságát független szakértői auditok támasztják alá: a senior mérnökök 96,6%-os egyezést értek el az aranyhalmaz validálásakor.