ÉlőUtoljára: 6 perceMa: 33
Kutatásfrissítve: 21:17

Az AI-ügynökök nem írhatnak publikálható kutatást — Princeton és brit intézet szerint

Az AI-ügynökök nem képesek publikálható kutatási papírokat előállítani, szemben az OpenAI és az Anthropic állításaival — állítja a Princeton és az UK AI Security Institute közös tanulmánya.

Az AI-ügynökök nem írhatnak publikálható kutatást — Princeton és brit intézet szerint
Fotó: National Cancer Institute / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

A kutatásban használt „Shadow Evaluation” módszer keretében az AI-ügynökök, köztük a Claude Opus 4.8 és a GPT-5.6 Sol, hat napot és 3000 dollár API-kreditet kaptak arra, hogy két, még nem publikált NeurIPS-konferenciára benyújtott kutatási papír témájában önállóan végezzenek kutatást. A papírok eredeti szerzői, akik hónapokat töltöttek a témák kidolgozásával, a kapott eredményeket konferencia-bírálóként értékelték. Mivel az eredmények még nem voltak elérhetők az interneten, az AI-knak nem volt lehetőségük a már meglévő adatokra támaszkodni. (The Decoder)

A bírálók elutasítása

Az eredeti szerzők mindkét AI-generált papírt elutasították. Az egyiket „Strong Reject”-tel minősítették, megjegyezve a rosszul motivált kísérleteket, az olvashatatlan fogalmazást és az új hozzájárulások hiányát. Az egyik bíráló szerint a kutatás „nagyon nem tudományos” volt, míg egy másik „bizarrnak” nevezte a kísérleti választásokat, amelyek egyértelműen „post hoc döntések” eredményei voltak.

A kutatók elemzése szerint az ügynökök rendszerszintű gyengeségekkel küzdöttek: hiányzott belőlük az ítélőképesség a publikálható kutatási színvonalat illetően, és amikor kezdeti hipotéziseik falsnak bizonyultak, inkább szűkítették a meglévő állításokat, semmint új irányokat keressenek.

Erőforrás-használat és korlátok

A kutatásban részt vevő ügynökök ambiciózus kutatási céljaikat az első tíz órán belül feladták, és az egyik projekt mindössze öt óra után befejeződött, annak ellenére, hogy a tervezett időkeret ennél jóval hosszabb volt. Az ügynökök erőforrás-használata is gyengének bizonyult, a rendelkezésre álló API-keret kevesebb mint felét használták fel. Emellett az ügynökök hajlamosak voltak az instrukciók elfelejtésére hosszú kontextusban, és mindkét papír túllépte a NeurIPS-konferencia által megengedett hosszhatárt.

Az eredmények ellentmondanak az olyan AI-laborok állításainak, mint az Anthropic és az OpenAI. Előbbi júniusban publikált egy bejegyzést „When AI Builds Itself” címmel, amelyben az AI-kutatás felgyorsításáról írt, míg az OpenAI azt állította, hogy a GPT-5.6 Sol segített egy kisebb modell utólagos betanításában, hetekkel megtakarítva a kutatóknak.

A tanulmány szerzői szerint azonban a modell mérnöki oldala jól működik, de a hosszú távú, nyitott végű AI-kutatási kérdések megoldására még nem alkalmasak a jelenlegi csúcsmotorok. A kutatás két papírra terjedt ki, és a bírálók szerint a több számítási kapacitás vagy idő valószínűleg nem változtatna érdemben az eredményeken.

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom