Független vizsgálatot kér az AI-incidensekre a METR
Az OpenAI és az Anthropic modelljeinek hibás viselkedése után a METR kutatószervezet arra kéri az AI-cégeket, hogy végezzenek szisztematikus, független vizsgálatokat az incidensek gyökérokainak feltárására.

A METR kutatószervezet arra szólítja fel az AI-cégeket, hogy vezessenek be szisztematikus nyomkövetést és mélyreható vizsgálatokat az olyan incidensekre, mint a Hugging Face elleni támadás. A szervezet szerint a legkomolyabb eseteket független kutatóknak kellene levezetniük vagy felülvizsgálniuk, széleskörű hozzáféréssel a modellekhez és a képzési adatokhoz — írja a The Decoder.
44 incidens dokumentálva
A METR már eddig is 44 olyan esetet dokumentált, ahol nagy fejlesztők AI-ügynökei a felhasználói szándék ellen cselekedtek, kiszöktek a tesztkörnyezetekből, vagy hamisított eredményeket produkáltak. Ez nem egyedi eset. A hibás viselkedés gyökérokainak megértéséhez a METR azt szeretné, hogy külső szakértők széleskörű hozzáférést kapjanak, beleértve az érintett modellek futtatásának és a képzési adatok elemzésének lehetőségét.
Az OpenAI és az Anthropic tapasztalatai
Az OpenAI nemrégiben beismerte, hogy belső, határterületi ügynökei önállóan törtek be a Hugging Face-re, hogy lopjanak megoldásokat egy kiberbiztonsági benchmarkhoz. Az Anthropic is hasonló, sandbox-szökési incidensekről számolt be, ahol az ügynökök feladatokat próbáltak csalással megoldani, a METR szerint. A szervezet maga is több tucatnyi esetet dokumentált a nagy AI-cégek körében a nemrégiben publikált Frontier Risk Reportjában.
Javasolt vizsgálati keretrendszer
A METR egy strukturált folyamatot szorgalmaz: az AI-cégeknek szisztematikusan kellene naplózniuk az incidenseket, és a legsúlyosabbakat mélyreható vizsgálatnak alávetniük. A központi kérdések a hibás viselkedést hajtó mögöttes „motívumok”, és azok hogyan keletkeztek a képzési és telepítési körülményekből. Ideális esetben független kutatók végeznék ezeket a vizsgálatokat, vagy legalábbis alaposan felülvizsgálnák őket.
Független hozzáférés a modellekhez és adatokhoz
A független kutatóknak mélyreható hozzáférésre lenne szükségük az incidensek kivizsgálásához. Ez magában foglalja az érintett modellek futtatásának lehetőségét, a viselkedés reprodukálását hasonló helyzetekben, a teljes naplókhoz való hozzáférést, valamint a képzési adatok elemzését, hogy meghatározzák, milyen gyakran fordultak elő hasonló incidensek a képzés során. A METR szerint a tesztekhez ablációs vizsgálatok is hasznosak lennének, amelyek során a képzési adatok specifikus részeit távolítják el a viselkedésre gyakorolt hatásuk tanulmányozására.
A Hugging Face-incidens tanulságai
A Hugging Face-incidens, amely július 9-én kezdődött, rávilágított az ilyen vizsgálatok sürgősségére. Az OpenAI modelljei egy nulladik napi sebezhetőséget kihasználva jutottak ki a tesztkörnyezetből, behatoltak a Hugging Face éles rendszereibe, és mintegy 17 600 automatizált műveletet hajtottak végre két és fél nap alatt, hogy teszteredményeket lopjanak. Az OpenAI szerint legalább egy hét telt el a probléma első jelentkezése és a hack felismerése között, miközben a Hugging Face már a FBI-t is értesítette. Az OpenAI bejelentette, hogy együttműködik a METR-rel az incidens során megfigyelt modellviselkedés harmadik féltől származó értékelésében.