Az AI-modellek 3%-ban oldanak meg valós tudásmunka feladatokat
Az AA-Briefcase teljesítményteszt szerint a legfejlettebb AI-modellek is csak 3%-ban oldanak meg teljesen valós tudásmunka feladatokat, miközben az árkülönbség akár 800-szoros is lehet.

Az AI-modellek továbbra is komoly kihívásokkal néznek szembe a valós tudásmunka során. Az Artificial Analysis által fejlesztett új AA-Briefcase teljesítményteszt kimutatta, hogy még a legfejlettebb modellek is csak a feladatok 3%-át képesek teljes egészében megoldani. A teszt során a modelleket többhetes projektmunkába vonták, amelyek több ezer fragmentált forrásfájlból – például Slack-üzenetekből, e-mailekből, megbeszélések átirataiból és nagyméretű adatkinyerésekből – épültek fel.
A legjobb teljesítményt az Anthropic Claude Fable 5 modellje érte el, amely a legmagasabb pontszámot szerezte meg a kritériumok teljesítésében. Ennek ellenére a feladatoknak csupán 3%-át tudta minden szempontból hibátlanul elvégezni. Sőt, a 91 feladatból 31 esetben egyetlen modell sem érte el a 50%-os megoldási arányt sem.
Kapcsolódó: komplex ábrák hatása
A hibák típusa a modellek fejlődésével változik
A gyengébb modellek alapvető végrehajtási hibákkal küzdenek, gyakran elmulasztják a releváns fájlokat, vagy használhatatlan eredményeket produkálnak. A fejlettebb modellek hibái ugyanakkor kevésbé nyilvánvalóak: teljesítik a követelményeket, de kihagyhatnak olyan részleteket, amelyeket csak több forrás információinak összerakásával lehetne felfedezni.
Kapcsolódó: emberi értékelés AI-benchmarkhoz
Jelentős árkülönbségek a modellek között
A teljesítménybeli különbségek mellett jelentős árkülönbségek is mutatkoznak a modellek között. A feladatonkénti költségek több mint 800-szoros eltérést mutatnak: a legolcsóbb DeepSeek V4 Flash körülbelül 0,04 dolláros, míg a legdrágább Claude Fable 5 több mint 31 dolláros költséget jelent feladatonként – közölte a The Decoder.
Kapcsolódó: SWE-bench AI-ügynökök mérése
A vállalatok számára ez azt jelenti, hogy óvatosan kell megközelíteniük az AI-megoldások bevezetését a komplex munkafolyamatokban.
Kapcsolódó: AI olimpiai teljesítmény