ÉlőUtoljára: 39 perceMa: 12
Eszközökfrissítve: 09:15

Nyílt forráskódú tesztgenerátort adott ki a Microsoft — 92,1%-os pontosság, a Copilot fölött

A Microsoft nyílt forráskódúvá tette a code-testing-generatort, egy AI-ügynököt, amely 92,1%-os pontossággal ír és ellenőriz egységteszteket, felülmúlva a GitHub Copilotot.

Nyílt forráskódú tesztgenerátort adott ki a Microsoft — 92,1%-os pontosság, a Copilot fölött
Fotó: Abid Shah / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A Microsoft kiadta a code-testing-generatort, egy nyílt forráskódú, MIT-licencelt AI-ügynököt, amely képes egységteszteket írni és azok helyességét ellenőrizni. Az eszköz a dotnet/skills repozitóriumban található, és a fejlesztők számára jelentős előrelépést kínál a kódminőség biztosításában. (MarkTechPost)

Az ügynök a fejlesztők által gyakran figyelmen kívül hagyott hiányosságokra reagál: nem csupán tesztgenerálást végez, hanem előtte elemzi a repozitóriumot. Ez alapján dönti el, hogy milyen tesztkeretrendszert, fájlhelyet vagy ellenőrzési módszert használjon. A Research-Plan-Implement (RPI) folyamat segítségével először megkeresi a tesztelendő kódot, felismeri a nyelvet és a tesztkeretrendszert, majd elemzi a meglévő teszteket a konvenciók megértéséhez, végül pedig megtalálja a valós build- és tesztparancsokat.

A Microsoft belső, 152 feladatból álló benchmarkján az ügynök 140 feladatot oldott meg sikeresen, szemben a GitHub Copilot 120 feladatával. Ez 78,9%-os teljesítményt jelent a Copilot esetében. A javulás főként a homályosabb utasítások és a specifikus diff-ekre célzó kérések esetén mutatkozott meg, ahol az ügynök 88,8%-os, illetve 96,8%-os pontossággal teljesített, míg a Copilot 66,3%-ot, illetve 96,8%-ot ért el. Érdekesség, hogy az új ügynök 2,3%-kal kevesebb tesztet generált (6963 vs. 7129), miközben a sorfedettség gyakorlatilag azonos maradt (72,4% vs. 72,2%), és az átlagos feladatidő is rövidebb volt (359 másodperc vs. 380 másodperc).

A code-testing-generator helyben futtatható, nem igényel felhőszolgáltatást, így a kód lokálisan marad. Ez különösen előnyös lehet szabályozott iparágakban, például a pénzügyi szolgáltatásokban, az egészségügyben vagy a közszférában, ahol a tesztadatok biztonsága és az auditálhatóság kiemelt fontosságú. Az ügynök képes a tesztlefedettség növelésére, különösen olyan moduloknál, amelyeket korábban nem teszteltek, vagy pull request-ekhez generál teszteket a kiadás előtt.

A .NET feladatok esetében az ügynök 43/45 feladatot oldott meg, míg a Claude Opus 4.8 35/45-öt, a GPT-5.5 pedig 41/45-öt. A külső SWE Atlas teljesítményteszten 16/44-es eredményt ért el a 12/44 ellenében. A Microsoft blogbejegyzése szerint ezek az eredmények a cég belső tesztjein alapulnak, és független ellenőrzésük még nem történt meg.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom