ÉlőUtoljára: 5 perceMa: 3
Kutatásfrissítve: 16:30

Az AI-modellek 3%-ban oldanak meg valós tudásmunka feladatokat

Az AA-Briefcase teljesítményteszt szerint a legfejlettebb AI-modellek is csak 3%-ban oldanak meg teljesen valós tudásmunka feladatokat, miközben az árkülönbség akár 800-szoros is lehet.

Az AI-modellek 3%-ban oldanak meg valós tudásmunka feladatokat
Fotó: Zach M / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

Az AI-modellek továbbra is komoly kihívásokkal néznek szembe a valós tudásmunka során. Az Artificial Analysis által fejlesztett új AA-Briefcase teljesítményteszt kimutatta, hogy még a legfejlettebb modellek is csak a feladatok 3%-át képesek teljes egészében megoldani. A teszt során a modelleket többhetes projektmunkába vonták, amelyek több ezer fragmentált forrásfájlból – például Slack-üzenetekből, e-mailekből, megbeszélések átirataiból és nagyméretű adatkinyerésekből – épültek fel.

A legjobb teljesítményt az Anthropic Claude Fable 5 modellje érte el, amely a legmagasabb pontszámot szerezte meg a kritériumok teljesítésében. Ennek ellenére a feladatoknak csupán 3%-át tudta minden szempontból hibátlanul elvégezni. Sőt, a 91 feladatból 31 esetben egyetlen modell sem érte el a 50%-os megoldási arányt sem.

Kapcsolódó: komplex ábrák hatása

A hibák típusa a modellek fejlődésével változik

A gyengébb modellek alapvető végrehajtási hibákkal küzdenek, gyakran elmulasztják a releváns fájlokat, vagy használhatatlan eredményeket produkálnak. A fejlettebb modellek hibái ugyanakkor kevésbé nyilvánvalóak: teljesítik a követelményeket, de kihagyhatnak olyan részleteket, amelyeket csak több forrás információinak összerakásával lehetne felfedezni.

Kapcsolódó: emberi értékelés AI-benchmarkhoz

Jelentős árkülönbségek a modellek között

A teljesítménybeli különbségek mellett jelentős árkülönbségek is mutatkoznak a modellek között. A feladatonkénti költségek több mint 800-szoros eltérést mutatnak: a legolcsóbb DeepSeek V4 Flash körülbelül 0,04 dolláros, míg a legdrágább Claude Fable 5 több mint 31 dolláros költséget jelent feladatonként – közölte a The Decoder.

Kapcsolódó: SWE-bench AI-ügynökök mérése

A vállalatok számára ez azt jelenti, hogy óvatosan kell megközelíteniük az AI-megoldások bevezetését a komplex munkafolyamatokban.

Kapcsolódó: AI olimpiai teljesítmény

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom