Az AI-ügynökök nem írhatnak publikálható kutatást — Princeton és brit intézet szerint
Az AI-ügynökök nem képesek publikálható kutatási papírokat előállítani, szemben az OpenAI és az Anthropic állításaival — állítja a Princeton és az UK AI Security Institute közös tanulmánya.

A kutatásban használt „Shadow Evaluation” módszer keretében az AI-ügynökök, köztük a Claude Opus 4.8 és a GPT-5.6 Sol, hat napot és 3000 dollár API-kreditet kaptak arra, hogy két, még nem publikált NeurIPS-konferenciára benyújtott kutatási papír témájában önállóan végezzenek kutatást. A papírok eredeti szerzői, akik hónapokat töltöttek a témák kidolgozásával, a kapott eredményeket konferencia-bírálóként értékelték. Mivel az eredmények még nem voltak elérhetők az interneten, az AI-knak nem volt lehetőségük a már meglévő adatokra támaszkodni. (The Decoder)
A bírálók elutasítása
Az eredeti szerzők mindkét AI-generált papírt elutasították. Az egyiket „Strong Reject”-tel minősítették, megjegyezve a rosszul motivált kísérleteket, az olvashatatlan fogalmazást és az új hozzájárulások hiányát. Az egyik bíráló szerint a kutatás „nagyon nem tudományos” volt, míg egy másik „bizarrnak” nevezte a kísérleti választásokat, amelyek egyértelműen „post hoc döntések” eredményei voltak.
A kutatók elemzése szerint az ügynökök rendszerszintű gyengeségekkel küzdöttek: hiányzott belőlük az ítélőképesség a publikálható kutatási színvonalat illetően, és amikor kezdeti hipotéziseik falsnak bizonyultak, inkább szűkítették a meglévő állításokat, semmint új irányokat keressenek.
Erőforrás-használat és korlátok
A kutatásban részt vevő ügynökök ambiciózus kutatási céljaikat az első tíz órán belül feladták, és az egyik projekt mindössze öt óra után befejeződött, annak ellenére, hogy a tervezett időkeret ennél jóval hosszabb volt. Az ügynökök erőforrás-használata is gyengének bizonyult, a rendelkezésre álló API-keret kevesebb mint felét használták fel. Emellett az ügynökök hajlamosak voltak az instrukciók elfelejtésére hosszú kontextusban, és mindkét papír túllépte a NeurIPS-konferencia által megengedett hosszhatárt.
Az eredmények ellentmondanak az olyan AI-laborok állításainak, mint az Anthropic és az OpenAI. Előbbi júniusban publikált egy bejegyzést „When AI Builds Itself” címmel, amelyben az AI-kutatás felgyorsításáról írt, míg az OpenAI azt állította, hogy a GPT-5.6 Sol segített egy kisebb modell utólagos betanításában, hetekkel megtakarítva a kutatóknak.
A tanulmány szerzői szerint azonban a modell mérnöki oldala jól működik, de a hosszú távú, nyitott végű AI-kutatási kérdések megoldására még nem alkalmasak a jelenlegi csúcsmotorok. A kutatás két papírra terjedt ki, és a bírálók szerint a több számítási kapacitás vagy idő valószínűleg nem változtatna érdemben az eredményeken.