Valós vállalati kódokon mérik meg az AI-modelleket az új teljesítményteszten
A nyolc vizsgált rendszer közül a Claude 38,8%-os pontossággal végzett a legjobb, míg a GPT-5.6 mindössze 16,2%-ot ért el.

A Real-SWE egy új teljesítményteszt, amely a legfejlettebb AI modelleket teszteli valós, privát vállalati kódokon. A feladatokat igazi cégek mérnökei által végzett munkák inspirálták, beleértve a számlázást, adózást és ügyfélmigrációt. (Hacker News)
A nyolc modell eredményei
A tesztelés során nyolc modell teljesítményét vizsgálták. A Fable 5.1 Claude érte el a legmagasabb, 38,8%-os feloldási arányt (pass@1), míg a GPT-5.6 (Sol Codex CLI) 16,2%-kal végzett a nyolcadik helyen. A Gemini 3.8 Flash 31,2%-ot, a Grok 4.6 pedig 23,8%-ot ért el.
Valós üzleti kontextus
A Real-SWE szerint a szintetikus feladatok nem tükrözik a valós vállalati kihívásokat. A teljesítményteszt a licencelt kódokon alapul, és olyan problémákat vizsgál, amelyek közvetlen üzleti hatással bírnak, ellentétben a nyilvánosan elérhető kódokkal.
A tesztelt modelleknek figyelembe kellett venniük a cégspecifikus szabályokat és kódolási konvenciókat. Egyetlen feladat megoldása akár 11 fájl szerkesztését is igényelhette, szemben más teljesítménytesztek 6 fájljával.
A fejlesztők a withspecific.com blogon hangsúlyozzák, hogy a Real-SWE jobban tükrözi a valós vállalati kihívásokat, mint a szintetikus adathalmazok.