Claude Opus 5 30,2%-os eredménnyel verte a GPT-5.6 Solt az ARC-AGI-3 teszten
Az Anthropic Claude Opus 5 30,2%-os eredményt ért el az ARC-AGI-3 teljesítményteszten, ami csaknem négyszerese az OpenAI GPT-5.6 Sol (Max) korábbi, 7,8%-os rekordjának.

Az Anthropic Claude Opus 5 modellje 30,2%-os pontszámot ért el az ARC-AGI-3 teszten, ezzel új csúcsot állítva fel. A korábbi rekordot az OpenAI GPT-5.6 Sol (Max) tartotta 7,8%-kal. Az ARC Prize kutatói szerint az Opus 5 jelentős előnye a fejlettebb logikai érvelésnek köszönhető, amely lehetővé teszi az autonóm tervezést és a nem ismert környezetekben való navigálást. A modell öt korábban megoldatlan feladatkörnyezetet is sikeresen teljesített, ebből négyet emberi szinten vagy afelett. Az eredmények alapján az Opus 5 felülmúlja az Anthropic korábbi, „Fable-osztályú” modelljeit is, amelyek körülbelül 20%-ot értek el. (The Decoder)
Az Opus 5 nem csupán a pontszámával tűnt ki, hanem korábban nem tapasztalt viselkedést is mutatott. A tesztek során a modell feladatokat fordított algebrai jelölésrendszerre, és önállóan fogalmazott meg reflexiós egyenleteket. Ezek a képességek az ARC Prize szerint az AI-modellekben eddig nem megfigyelt viselkedésformák. Az ARC-AGI-3 teljesítményteszt célja az, hogy az edzés során nem látott, új feladatok megoldására való képességet mérje, tesztelve ezzel az általános érvelést és nem a tárolt tudást. A teljes eredmények, lejátszások és a kód nyilvánosan elérhetők.
Kapcsolódó: Claude Opus 4.7 kódolási képességei
Az Opus 5 teljesítménye más ARC-teszteken
Az Opus 5 az ARC-AGI-2 teljesítményteszten 90,4%-ot, az ARC-AGI-1-en pedig 97,5%-ot ért el. Bár ezek az eredmények megegyeznek a korábbi legjobb pontszámokkal, az ARC Prize szerint kissé magasabb számítási költséggel jártak. Az ARC-AGI-3 egy interaktív játékként működik, ahol a modellnek ki kell követnie a környezet szabályait, meg kell terveznie a lépéseit, és végre kell hajtania azokat. Ez a tesztelés a tárolt tudás helyett az általános érvelési képességeket helyezi előtérbe.
Kapcsolódó: Claude Opus 4.7 előnye
Szűkebb előrelépés független teszteken
Független tesztek a Witness teljesítményteszten szűkebb előrelépést mutattak. Az Opus 5 43,4 pontot ért el, ami statisztikailag megegyezik a Kimi K3 és a Fable 5 eredményével, és jóval kisebb javulást jelent az Opus 4.8-hoz képest, mint az ARC-AGI-3-on tapasztalt növekedés. Guanghan Ning, a Witness teljesítményteszt készítője szerint ez a minta a műfajspecifikus adatokon való edzésre utalhat, bár a teszt nem tudja pontosan azonosítani az Anthropic által felhasznált adatokat. Ning ugyanakkor pontosította, hogy az Opus 5 szélesebb körű fejlődést mutatott a Witnessen is, de jóval kisebb mértékben, mint az ARC-AGI-3-on.
Kapcsolódó: Claude Opus 4.7 csúcson
Az Anthropic nem magyarázta meg a jelentős növekedés pontos okát, de a kutatók szerint a célzott adatkondicionálás és a megerősítéses tanulás (reinforcement learning) lehetséges tényezők lehetnek. Mivel az Opus 5 az ARC-AGI-3 formátumának publikussá válása után készült, az Anthropic célzottan fejleszthette a teljesítményteszt képességeire, anélkül, hogy pontosan ugyanazokon a feladatokon edzette volna a modellt. A fejlesztők valószínűleg azonosították és címkézték a hasonló rejtvényekből származó érvelési nyomokat, sikertelen kísérleteket és helyreállítási lépéseket, amelyeket a megerősítéses tanulás jutalmazhatott.
Kapcsolódó: Claude Opus 4.7 kódolási teszt
Greg Kamradt, az ARC-AGI-3 egyik kutatója szerint az eredmények nem zárják ki a szélesebb körű érvelési előrelépéseket. A hagyományos rejtvények ismerős mechanizmusokat használhatnak, míg egy szokatlan játékban tapasztalt gyengébb teljesítmény csak egyedi regresszió lehetett. Kamradt megjegyezte, hogy az Opus 4.8 is jobban teljesített néhány ARC-AGI-3 játékon, mint az Opus 5, annak ellenére, hogy összességében jelentősen elmaradt tőle. Mivel az Opus 5 a Witnessen egészében javult, a fejlődés szélességének megítélése további, ismeretlen feladatokra vonatkozó részletes eredményeket igényelne.
Kapcsolódó: Claude Opus 4.7 új funkciói