ÉlőUtoljára: 1 órájaMa: 11
Kutatásfrissítve: 10:16

Elutasították a top-konferenciákon a Princeton-kutatók AI-papírjait

Hat napos, 3 000 dolláros teszt során a Princeton kutatók azt találták, hogy az AI-ügynökök által készített kutatási papírokat a szerzők elutasították top-konferencia szintjén.

Elutasították a top-konferenciákon a Princeton-kutatók AI-papírjait
Fotó: CDC / Unsplash
forrás: Hacker News·AI Forradalom szerk.·
Megosztás

Shadow evaluation módszer

A tanulmányban két, a NeurIPS 2026-ra benyújtott, még nem publikált dolgozatot használtak kiindulópontként, és a kutatók egy új értékelési eljárást, a „shadow evaluation”-t vezettek be — írja az MIT Technology Review. (Hacker News)

Az ügynökök mérnöki teljesítménye

Az Anthropic Claude Opus 4.8 modell, az OpenClaw szoftverrel futtatva, képes volt a teljes kutatási folyamatot technikailag megvalósítani: irodalmat átnézett, több száz kísérletet futtatott, és a kapott eredményeket összegyűjtötte.

Kreativitás és ítélet hiánya

Azonban a kutatók szerint az AI-ügynökök egyértelműen rosszul végezték a kutatást; a papírok írása szintetikus, a hipotézisek tesztelése gyakran apró, szintetikus adathalmazokon történt, és a végső szöveg nem közelítette meg a top-konferencia elvárásait.

Miért fontos a kreatív döntéshozatal

A hiányzó kreativitás és ítélet – ahogy Kapoor megjegyezte – megakadályozza, hogy az AI-ügynökök önállóan új kutatási irányokat fedezzenek fel vagy elhagyják a rossz megközelítéseket, ami a gyors rekurzív önfejlesztés idővonalát is eltolhatja.

Jövőbeli kísérletek és korlátok

A tanulmány korlátai között szerepel, hogy csak két papírral dolgoztak, és a szerzők tudták, hogy a cikkeket AI generálta, ami befolyásolhatta az értékelést. A Princeton csapat jelenleg a Mythos, az Anthropic legújabb modelljével folytatja a vizsgálatot.

Forrás

Feldolgozott sajtóforrás·Hacker News

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom