Adatkurálást automatizálhatnak az általános AI-ügynökök, új teljesítményteszt szerint
Az általános AI-ügynökök képesek futtatni az adatkészítési folyamatot, de a megbízható kutatáshoz módszeradaptáció szükséges, nem csak nyílt végű utasítások — közli az arXiv.

Az adatok kurálása az AI-fejlesztés egyik legfontosabb, mégis legmunkaigényesebb része. A kutatók most egy új benchmarkkal, a Curation-Bench-csel vizsgálták, hogy az általános kódoló AI-ügynökök képesek-e automatizálni ezt a folyamatot. A rendszer rögzített modellel, betanítási recepttel és értékelőcsomaggal működik, miközben az ügynökök parancssori hozzáféréssel ellenőrizhetik az adatokat, bevezethetnek irányelveket, és módosíthatják azokat. (ArXiv AI)
Egy látás-nyelv alapú oktatási példában az azonnal használható ügynökök tíz iteráción belül elérik a korábbi, publikált adatszelekciós alapvonalakat — írja az arXiv. Az elemzés azonban rámutatott egy tartós végrehajtási-kutatási résre: az ügynökök főként helyi irányelvvariánsokat finomítanak, ahelyett, hogy új irányelvcsaládokat fedeznének fel, még stratégiai útmutatók és szakirodalmi hivatkozások ellenére is.
Kapcsolódó: LLM-ek fejlesztése
A kurálás folyamata
Olyan keretrendszerek, amelyek minden iterációt egy korábbi módszer idézésére, példányosítására és adaptálására köteleznek, az ügynököket módszervezérelt felfedezés felé terelik. Az ilyen módszerrel támogatott ügynökök emberi tervezési bevitel nélkül, önállóan állítanak össze egy adatszelekciós irányelvet, amely a korábbi erős publikált alapvonalakat is felülmúlja, mindössze egytized akkora adatkerettel.
Kapcsolódó: Vizuális AI-ügynökök
Új irányelvek felfedezése
Az eredmények azt mutatják, hogy bár a jelenlegi ügynökök képesek futtatni a kurálási folyamatot, a megbízható adatkutatás nem pusztán nyílt végű promptoláson alapul, hanem a módszerek adaptációját igényli. A Curation-Bench teszt 2024. március 15-én lesz elérhető az arXiv oldalán.
Kapcsolódó: LLM-ek megbízhatósága