ÉlőUtoljára: 39 perceMa: 3
Kutatásfrissítve: 09:50

Új MacArena teljesítményteszt teszteli a macOS-es AI-ügynököket, 26%-os különbség a modellek között

Az új MacArena teljesítményteszt 421 feladattal teszteli az Apple Siliconon futó AI-ügynököket, feltárva a macOS-specifikus kihívásokat. A modellek teljesítménye jelentősen eltérhet a natív és a portolt feladatok között.

Új MacArena teljesítményteszt teszteli a macOS-es AI-ügynököket, 26%-os különbség a modellek között
Fotó: BoliviaInteligente / Unsplash
forrás: ArXiv ML·AI Forradalom szerk.·
Megosztás

Új teljesítménytesztet mutatott be egy kutatócsoport, amely az Apple Siliconon futó AI-ügynökök (Computer Use Agents, CUAs) teljesítményét méri. A MacArena 421, kézzel ellenőrzött feladatot foglal magában, 50 különböző alkalmazáson keresztül. A cél, hogy pontosabb képet adjon az ügynökök valós macOS-környezetben nyújtott képességeiről, mivel a korábbi, Linux-alapú teljesítménytesztek nem tükrözik a macOS egyedi grafikus felhasználói felületi (GUI) kihívásait. (ArXiv ML)

A kutatók szerint a meglévő értékelőeszközök, mint az OSWorld, bár fejlesztenek és képzési környezetként is szolgálnak, korlátozottan alkalmasak a macOS környezet tesztelésére. Az Apple Siliconra optimalizált MacArena a korábbi OSWorld és macOSWorld feladatok mellett 49 új, macOS-specifikus feladatot is tartalmaz.

Kapcsolódó: Emergence WebVoyager

A MacArena tesztelési lehetőségei

Ez lehetővé teszi a modellek valódi cross-platform képességeinek mérését, szemben a korábbi, x86 alapú virtuális gépeken futó tesztekkel. Az eredmények rávilágítanak arra, hogy a korábbi benchmarkokon jól teljesítő modellek nem feltétlenül rendelkeznek általános GUI-kompetenciával.

Kapcsolódó: Mimosa Framework

A modell teljesítmények értelmezése

A MacArena tesztjeiben a modellek rangsora jelentősen megváltozott a portolt és a macOS-natív feladatok között. Egy vezető modell például több mint 26%-kal gyengébben teljesített a MacArena natív feladatain, ami arra utal, hogy a macOS valóban nehezebb környezetet jelent az AI-ügynökök számára. A kutatás eredményei az arXiv-on érhetők el, és a csapat a teljesítményteszt további bővítésén dolgozik az Apple ökoszisztémájában.

Kapcsolódó: AI-ügynökök eszköztudása

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom