Elutasították a top-konferenciákon a Princeton-kutatók AI-papírjait
Hat napos, 3 000 dolláros teszt során a Princeton kutatók azt találták, hogy az AI-ügynökök által készített kutatási papírokat a szerzők elutasították top-konferencia szintjén.

Shadow evaluation módszer
A tanulmányban két, a NeurIPS 2026-ra benyújtott, még nem publikált dolgozatot használtak kiindulópontként, és a kutatók egy új értékelési eljárást, a „shadow evaluation”-t vezettek be — írja az MIT Technology Review. (Hacker News)
Az ügynökök mérnöki teljesítménye
Az Anthropic Claude Opus 4.8 modell, az OpenClaw szoftverrel futtatva, képes volt a teljes kutatási folyamatot technikailag megvalósítani: irodalmat átnézett, több száz kísérletet futtatott, és a kapott eredményeket összegyűjtötte.
Kreativitás és ítélet hiánya
Azonban a kutatók szerint az AI-ügynökök egyértelműen rosszul végezték a kutatást; a papírok írása szintetikus, a hipotézisek tesztelése gyakran apró, szintetikus adathalmazokon történt, és a végső szöveg nem közelítette meg a top-konferencia elvárásait.
Miért fontos a kreatív döntéshozatal
A hiányzó kreativitás és ítélet – ahogy Kapoor megjegyezte – megakadályozza, hogy az AI-ügynökök önállóan új kutatási irányokat fedezzenek fel vagy elhagyják a rossz megközelítéseket, ami a gyors rekurzív önfejlesztés idővonalát is eltolhatja.
Jövőbeli kísérletek és korlátok
A tanulmány korlátai között szerepel, hogy csak két papírral dolgoztak, és a szerzők tudták, hogy a cikkeket AI generálta, ami befolyásolhatta az értékelést. A Princeton csapat jelenleg a Mythos, az Anthropic legújabb modelljével folytatja a vizsgálatot.