A Claude vezeti a kutatás 26%-át az Anthropicnál, a modell még emberi felügyeletet igényel
Az Anthropic kutatási munkájának 26%-át már Claude végzi, míg az OpenAI kutatói 3,1 AI-napnyi feladatot delegálnak minden emberi munkanapra, ám a modellek még emberi felügyeletet igényelnek.

Az Anthropic mérési rendszere még prototípusnak számít, és részben magát a Claude-ot használja a Claude-segítette munka osztályozására és értékelésére. Az OpenAI hasonló tendenciákat tapasztal. A cég szerint rendszereik elérték az „automatizált kutatási gyakornok” stádiumot, képesek jól definiált kutatási feladatokat elvégezni, amelyek egy képzett kutatónak több napot vennének igénybe. Az OpenAI kutatói hosszabb feladatokat delegálnak, és kutatási szervezetükben minden emberi munkanapra 3,1 „ügynöknapnyi” munkát végeztetnek a rendszereikkel. (The Neuron)
Mérési módszertan és autonómia szintje
Az AI-kutatás automatizálásának sebessége és mértéke kulcsfontosságú a kockázatok felmérése szempontjából. Azok a kutatólaborok, amelyek maguk automatizálják a kutatási folyamatokat, rendelkeznek a legjobb adatokkal arra vonatkozóan, hogy ez az automatizáció milyen gyorsan halad előre. Ez információs aszimmetriát eredményez, ami aggodalomra ad okot, különösen, ha a kockázatok a sebességgel függnek össze.
Biztonsági garanciák és független ellenőrzés
A helyzet rávilágít arra, hogy szükség van független tesztelésre, pontos kiadási nyelvezetre és nyilvános biztonsági jelentésekre. Az AI-laboroknak bizonyítékokkal kell megkeresniük a társadalom bizalmát, nem üres szlogenekkel. A nemzetközi közösség, beleértve az ENSZ Közgyűlését és nemzetközi panelokat, figyelmeztet az AI-biztonsági garanciák gyengülésére, ami sürgeti az ellenőrizhető felügyeletet a puszta kijelentések helyett.
Az Anthropic és az OpenAI jelentései, bár eltérő módszertannal, mind azt mutatják, hogy az AI-modellek egyre inkább bekapcsolódnak a kutatás-fejlesztési ciklusokba. Azonban a prototípus mérési rendszerek és az önbevalláson alapuló eredmények azt jelzik, hogy a teljes autonómia és a kockázatok független értékelése még várat magára. Az OpenAI kutatói 3,1 ügynöknapot használnak fel minden emberi munkanapra, míg az Anthropicnál a Claude 26%-ban vezeti a kutatási munkát.