ÉlőUtoljára: 20 perceMa: 25
Kutatásfrissítve: 18:45

Tízszeres tokenkerettel 25%-kal jobbak az AI-ügynökök, az eddigi tesztek félrevezetőek

A brit AI Safety Institute (AISI) kutatása szerint a jelenlegi AI-tesztek szisztematikusan alábecsülik az ügynökök képességeit, ha korlátozott a számítási kapacitás. Tízszeres tokenkerettel 25%-kal javulnak a szoftverfejlesztési feladatok eredményei.

Tízszeres tokenkerettel 25%-kal jobbak az AI-ügynökök, az eddigi tesztek félrevezetőek
Fotó: National Institute of Allergy and Infectious Diseases / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

A brit AI Safety Institute (AISI) új tanulmánya rávilágít, hogy a jelenlegi AI-tesztek szisztematikusan alábecsülik az AI-ügynökök képességeit, amennyiben korlátozottak a számítási költségvetések. Az AISI kutatói hét különböző teljesítményteszten teszteltek csúcskategóriás modelleket, eltérő számítási keretekkel. Az eredmények szerint az AI-ügynökök teljesítménye egy görbét követ, amely emelkedik a tesztidő alatt rendelkezésre álló feldolgozási teljesítménnyel. (The Decoder)

Számítási kapacitás és teljesítmény

A több számítási kapacitás szinte minden területen jobb eredményeket hoz. A kiberbiztonsági feladatoknál az esetek körülbelül 8%-a csak akkor oldódott meg, ha a keret meghaladta a 10 millió tokent, egyes esetekben pedig 50 millió tokenre volt szükség. Az újabb modellek 100 millió token felett még magasabb pontszámokat értek el. A szoftverfejlesztési feladatoknál (TerminalBench 2.0, SWE-Bench Pro) a sikerráta mintegy 25%-kal ugrott meg, amikor a tokenkeret 1 millióról 10 millióra nőtt. A matematikai és tudományos feladatoknál (Humanity's Last Exam) a növekedés nagyjából 22% volt 5 millió tokenig terjedő keretig.

Kapcsolódó: AI benchmark hibák

Határterületek és korlátozások

Az extra számítási kapacitás nem minden területen segít egyformán. A HealthBench nevű orvosi teljesítményteszten minden modell elérte platóját a standard kereten belül. Az AISI szerint a több számítási kapacitás ott segít a legtöbbet, ahol az ügynökök ellenőrizni tudják saját munkájukat, például kód futtatásával vagy egy exploit tesztelésével. Kevésbé mozdítja el a tűt ott, ahol hiányzik vagy késik a visszajelzés.

Kapcsolódó: AI ügynökök teljesítménye

Egy másik fontos megfigyelés, hogy az emberi szakértő által egy feladat elvégzéséhez szükséges idő arányos az ügynök tokenfelhasználásával. Az METR kutatóintézet 211 szoftverfejlesztési és 78 AISI által végzett kiberbiztonsági feladatánál ez a kapcsolat egy hatványfüggvényt követ. A rögzített értékelési keret ezért levágja a leghosszabb és legnehezebb feladatokat. A sikertelenség azt jelentheti, hogy a keret volt túl szűk, nem pedig azt, hogy az ügynöknek hiányzott a képessége.

Kapcsolódó: Tokenköltségek növekedése

Az újabb modellek a vártnál jobban profitálnak a megnövelt számítási kapacitásból. A képességgörbe minden új generációval felfelé tolódik, és három tengelyen változik: hatótávolság (nehezebb feladatok válnak megoldhatóvá), megbízhatóság (ugyanazt a feladatot gyakrabban oldják meg), és hatékonyság (ugyanaz a feladat kevesebb tokent igényel). Egy jelenlegi csúcskategóriás modell időhorizontja 2,5 millió tokenes keretnél 40 percről 50 millió tokennél körülbelül négy órára nőtt. Az AISI becslései szerint a keret megválasztása befolyásolja a haladás ütemét; magasabb keretek mellett a fejlődés sokkal gyorsabbnak tűnik.

Kapcsolódó: AI tudásmunka képessége

Az AISI szerint a legfontosabb tanulság a mérés módjában rejlik. Ha a képességeket a számítási kapacitás függvényében görbeként kezeljük ahelyett, hogy fix pontszámként tekintenénk rájuk, folyamatosan meglepődni fogunk azokon a képességeken, amelyeket ezek a rendszerek képesek megmutatni, ha többet költenek rájuk. Az AISI most több különböző kerettel futtatja a csúcskategóriás modelleket, hogy meghatározza a „minimálisan informatív kereteket”.

Kapcsolódó: AI iOS app kísérlet

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom