Új MacArena teljesítményteszt teszteli a macOS-es AI-ügynököket, 26%-os különbség a modellek között
Az új MacArena teljesítményteszt 421 feladattal teszteli az Apple Siliconon futó AI-ügynököket, feltárva a macOS-specifikus kihívásokat. A modellek teljesítménye jelentősen eltérhet a natív és a portolt feladatok között.

Új teljesítménytesztet mutatott be egy kutatócsoport, amely az Apple Siliconon futó AI-ügynökök (Computer Use Agents, CUAs) teljesítményét méri. A MacArena 421, kézzel ellenőrzött feladatot foglal magában, 50 különböző alkalmazáson keresztül. A cél, hogy pontosabb képet adjon az ügynökök valós macOS-környezetben nyújtott képességeiről, mivel a korábbi, Linux-alapú teljesítménytesztek nem tükrözik a macOS egyedi grafikus felhasználói felületi (GUI) kihívásait. (ArXiv ML)
A kutatók szerint a meglévő értékelőeszközök, mint az OSWorld, bár fejlesztenek és képzési környezetként is szolgálnak, korlátozottan alkalmasak a macOS környezet tesztelésére. Az Apple Siliconra optimalizált MacArena a korábbi OSWorld és macOSWorld feladatok mellett 49 új, macOS-specifikus feladatot is tartalmaz.
Kapcsolódó: Emergence WebVoyager
A MacArena tesztelési lehetőségei
Ez lehetővé teszi a modellek valódi cross-platform képességeinek mérését, szemben a korábbi, x86 alapú virtuális gépeken futó tesztekkel. Az eredmények rávilágítanak arra, hogy a korábbi benchmarkokon jól teljesítő modellek nem feltétlenül rendelkeznek általános GUI-kompetenciával.
Kapcsolódó: Mimosa Framework
A modell teljesítmények értelmezése
A MacArena tesztjeiben a modellek rangsora jelentősen megváltozott a portolt és a macOS-natív feladatok között. Egy vezető modell például több mint 26%-kal gyengébben teljesített a MacArena natív feladatain, ami arra utal, hogy a macOS valóban nehezebb környezetet jelent az AI-ügynökök számára. A kutatás eredményei az arXiv-on érhetők el, és a csapat a teljesítményteszt további bővítésén dolgozik az Apple ökoszisztémájában.
Kapcsolódó: AI-ügynökök eszköztudása