ÉlőUtoljára: 2 perceMa: 30
Kutatásfrissítve: 21:15

Új nyílt teljesítménytesztet indított a GitHub az AI kódbeszélő ügynökök mérésére

A GitHub új, nyílt benchmarkja, a ReviewBench, valós kódkérésmintákon teszteli az AI kódértékelő ügynököket, 19 programozási nyelven.

Új nyílt teljesítménytesztet indított a GitHub az AI kódbeszélő ügynökök mérésére
Fotó: Luca Bravo / Unsplash
forrás: GitHub Blog·AI Forradalom szerk.·
Megosztás

A ReviewBench 219 nyilvános kódkérésen alapul, 19 programozási nyelven, és a GitHub több mint 100 millió valós kódkérésének mintázatait követi a nyelv, a tároló mérete és a változás alakja tekintetében. (GitHub Blog)

Adathalmaz és módszertan

A teljesítményteszt több forrásból származó „golden set”-et használ, beleértve emberi felülvizsgálókat, fejlett LLM-eket és statikus elemzési eszközöket. Minden talált hibát súlyosság és kategória szerint címkéznek, ami lehetővé teszi a felhasználó-specifikus szeleteket.

Értékelési mutatók és hitelesség

A négy értékelési metrika – a grounded precision, grounded recall, augmented precision és augmented recall – segít objektíven összehasonlítani a különböző kódértékelő rendszereket. A ReviewBench megbízhatóságát független szakértői auditok támasztják alá: a senior mérnökök 96,6%-os egyezést értek el az aranyhalmaz validálásakor.

Forrás

Feldolgozott sajtóforrás·GitHub Blog

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom