ÉlőUtoljára: 21 perceMa: 11
Kutatásfrissítve: 09:10

A Cognition FrontierCode-ja 13 százalékos eredményt hoz az Opus 4.8-nak

A Cognition FrontierCode-ja 13 százalékos eredményt hozott az Opus 4.8-nak. A teszt a kód beilleszthetőségét méri, és a legfejlettebb modellek is csak alacsony eredményt értek el.

A Cognition FrontierCode-ja 13 százalékos eredményt hoz az Opus 4.8-nak
Fotó: Slavcho Malezan / Unsplash
forrás: Latent Space·AI Forradalom szerk.·
Megosztás

A Cognition új teljesítménytesztet indított, a FrontierCode-ot, amely a kódolási feladatok minőségét és karbantarthatóságát méri. A cél, hogy megkülönböztesse a működő, de nehezen karbantartható kódokat a valóban beilleszthető megoldásoktól. A feladatokat vezető nyílt forráskódú fejlesztők készítették, mindegyik több mint 40 órás munkát igényelt. (Latent Space)

A kód minősége a tét

A hagyományos kódolási teljesítménytesztek gyakran csak azt vizsgálják, hogy a generált kód fut-e és átmegy-e az egységteszteken. A FrontierCode ennél tovább megy: olyan dimenziókat is értékel, mint a regressziós biztonság, a kód tisztasága, a hatókör, a tesztek helyessége és a karbantarthatóság. Ez azért fontos, mert a fejlesztők gyakran szembesülnek olyan kódokkal, amelyek elsőre működnek, de később problémákat okoznak a rendszerekben.

Kapcsolódó: AI ügynök appja

Az AI-modellek teljesítménye

A legfrissebb eredmények szerint a legjobb modellek is csak szerényen teljesítenek a FrontierCode legnehezebb feladatain. Az Opus 4.8, amely a mezőny egyik éllovasa, mindössze 13%-os eredményt ért el ezen a szegmensen. Ez jelentős eltérés a hagyományos benchmarkokon tapasztalható, gyakran 50% feletti eredményektől, ami arra utal, hogy a kódolás még korántsem tekinthető teljesen megoldott problémának az AI számára.

Kapcsolódó: AI-ügynök hibák

A teljesítményteszt háttere

A FrontierCode-ot a korábbi SWEBench-Verified munkák ihlették, és kifejezetten a „frontier” modellek számára készült, rendkívül nehéz problémákra összpontosítva. A tesztelés során figyelembe vették a 10 000 tokenes kontextusablakot, a Python-hozzáférést és a kísérletek futtatásának lehetőségét is. Az eredmények azt mutatják, hogy még ezekkel az előnyökkel is alacsony a sikerráta a minőségi kritériumok teljesítésében.

Kapcsolódó: LLM kódellenőrzés

A Cognition a FrontierCode-nal elért eredmények alapján további fejlesztéseket tervez az AI-modellekben, és az Opus 4.8 13%-os eredménye fontos mérföldkő a kódolási teljesítmény értékelésében.

Kapcsolódó: Anchor rendszer

Forrás

Feldolgozott sajtóforrás·Latent Space

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom