Új teljesítményteszt méri, hogy az AI-ügynökök képesek-e hosszú távon is sikeresen vezetni egy céget
Az LLM-ügynökök a rövid távú feladatokban jeleskednek, de a hosszú távú, bizonytalan kihívásokkal meggyűlik a bajuk — ezt méri a Stanford és a Google Robotics új CEO-Bench benchmarkja.

Az LLM-ügynökök egyre jobban teljesítenek izolált, rövid távú feladatokban, mint a szoftverfejlesztés vagy az ügyfélszolgálat. A valós kihívások azonban összetett készségeket igényelnek, amelyeket eddig kevésbé teszteltek: hosszú távú navigáció bizonytalanság mellett, információgyűjtés zajos környezetben, változó világhoz való alkalmazkodás és több mozgó alkatrész összehangolása egy koherens cél érdekében. A kutatók szerint ezeket a képességeket együtt méri a CEO-Bench. (ArXiv AI)
Startup-szimuláció a valósághű tesztelésért
A CEO-Bench egy 500 napos startup-szimulációban értékeli az ügynökök teljesítményét. Az ügynökök egy programozható Python interfészen keresztül kezelik a cég árképzését, marketingjét, költségvetését és számos más szempontot, ugyanabban a környezetben és hasonló kihívásokkal néznek szembe, mint egy emberi vezérigazgató. A sikerhez zajos, összekapcsolt üzleti adatbázisok elemzése, jelek átfordítása stratégiává és sok döntés összehangolása szükséges.
Kapcsolódó: HORIZON teljesítményteszt
Korlátozott sikerek a legerősebb modellekkel is
A legerősebb ügynökök fejlett kódot írnak, amely ügyfélkohortokat szimulál a jövőbeli készpénz előrejelzéséhez, és a tárgyalási előzményeket bányásszák rejtett ügyfélpreferenciák feltárására. Ennek ellenére a legtöbb korszerű modell nehezen boldogul ebben a környezetben. A kutatók beszámolói szerint csak a Claude Opus 4.8 és a GPT-5.5 tudott 1 millió dolláros induló egyenleg felett végezni, és egyik sem tudott következetesen profitot termelni. A CEO-Bench az első lépés az intelligencia mérésében, amely fenntartott, adaptív haladáshoz szükséges idővel.
Kapcsolódó: AI-ügynökök hosszú elemzésekben
A hosszú távú gondolkodás kulcsfontosságú
A jelenlegi LLM-ügynökök kiválóan teljesítenek rövid távú feladatokban, de a hosszú távú, bizonytalan környezetekben való eligazodás továbbra is komoly kihívást jelent. A CEO-Bench ezt a képességet méri, ami elengedhetetlen a valós üzleti kihívások kezeléséhez. A teljesítményteszt eredményei arra utalnak, hogy bár az AI fejlődik, a stratégiai gondolkodás és a hosszú távú tervezés terén még jelentős fejlesztésre van szükség.
Kapcsolódó: Akcióráta és elutasítási jel
A kutatás eredményei előnyomtatott formában jelentek meg az arXiv-on. A további modellek teljesítménye a CEO-Bench platformon még nem ellenőrzött.
Kapcsolódó: PIVOT módszer