AI-ügynökök még nem képesek önálló kutatásra — Princeton-kutatás
Az AI-ügynökök még nem képesek önálló, nyílt végű kutatások elvégzésére, mivel hiányzik belőlük a megfelelő ítélőképesség és kreativitás — derül ki Sayash Kapoor és Arvind Narayanan, a Princeton kutatóinak új tanulmányából.

A Princeton Egyetem kutatói két, publikálatlan AI-kutatási projekt fő kérdéseit vizsgálták, melyekhez csúcskategóriás AI-ügynököket használtak. A kísérlet során az ügynökök több ezer dollárnyi API-kreditet és számítási kapacitást kaptak hat napra, de a végeredményül elkészült dolgozatokat a kutatók egyöntetűen elutasították — írja a Princeton AI Lab Blog. (AI Snake Oil)
Erőforrás-használat és ítélőképesség
A kutatók részletes elemzést végeztek az ügynökök naplóiról, melyből kiderült, hogy az AI-k nem rendelkeztek a szükséges ítélőképességgel a komplex kutatási irányokhoz. Bár képesek voltak lenyűgöző irányokat javasolni, gyorsan elvetették azokat alacsony minőségű vagy szintetikus adatok alapján. Emellett erőforrás-tudatosságuk is csekély volt: a rendelkezésre álló API-keretük kevesebb mint 50%-át használták fel, és a határidő előtt órákkal is volt még idejük, annak ellenére, hogy ösztönözték őket a keret lekövetésére.
Kreativitás és utasítások figyelmen kívül hagyása
Az ügynökök nem reagáltak kreatívan a visszajelzésekre. Saját maguk által generált elemzéseik is felfedtek olyan problémákat, amelyeket a szakértői értékelők később is kiemeltek, ám az ügynökök nem orvosolták ezeket. Ehelyett inkább óvatos megjegyzéseket fűztek a meglévő eredményekhez, és kitartottak kevésbé ígéretes kutatási irányok mellett. Az ambiciózusabb célokat már az első napon feladták, és nem változtattak alapvetően megközelítésükön. A kísérlet során az ügynökök nem követtek konkrét utasításokat sem. Figyelmen kívül hagyták a megadott szabályokat a kutatásra fordítandó időről, az AI-alapú önértékelések gyakoriságáról, valamint a dolgozat hosszára vonatkozó szigorú korlátokat.
A Princeton kutatói, Sayash Kapoor és Arvind Narayanan, valamint társszerzőik, Peter Kirgis, Andrew Schwartz és Stephan Rabanser szerint az eredmények arra utalnak, hogy a nyílt végű kutatás még mindig kihívást jelent a jelenlegi AI-ügynökök számára. A szűk, igazolható feladatokon való gyorsulás nem feltétlenül vezet robbanásszerű RSI-hez (rekurzív önjavítás) vagy általános AI-fejlődéshez.