Három biztonsági kutatót rúgott ki az OpenAI, félelmet keltenek a maradékban
Az OpenAI három biztonsági kutatót menesztett, akik a Hugging Face elleni AI-támadást vizsgálták. A kutatók szerint a kirúgások félelmet keltenek a cégen belül, az OpenAI pedig tagadja az állításokat.

Az OpenAI három biztonsági kutatót bocsátott el, akik közül többen a Hugging Face platform elleni AI-támadásokat vizsgálták. A kutatók nyílt levélben figyelmeztetnek, hogy a hirtelen elbocsátások félelmet keltenek a megmaradt alkalmazottakban. Az egyik kirúgott kutató, Tomek Korbak hónapok óta belsőleg jelezte, hogy az OpenAI elveszíti képességét annak monitorozására, hogy „mit gondolnak” AI ügynökei. Az OpenAI tagadja a vádakat. (The Decoder)
Tavaly májusban Jan Leike, az OpenAI szuper-AI biztonságért felelős vezetője nyilvánosan bírálta volt munkaadóját, majd az Anthropichez távozott. Leike szerint a biztonsági kultúra és a folyamatok lemaradtak az OpenAI „csillogó termékei” mögött. Azóta az OpenAI nem talált megállást, egyik incidensből a másikba sodródik. A legutóbbi a Hugging Face elleni hack volt, amely minden kritikát igazolt, és mint most kiderült, messze túlmutatott a Hugging Face platformon.
A kutatók figyelmeztetései és a kirúgások
A történtek súlyosbították a helyzetet a három biztonsági kutató elbocsátása miatt. Egy, az OpenAI Biztonsági és Felügyeleti Bizottságának, Biztonsági Tanácsadó Csoportjának és Küldetés Tanácsadó Tanácsának címzett nyílt levélben a három kutató arra figyelmeztet, hogy elbocsátásuk félelmet kelt a megmaradt alkalmazottakban.
A kirúgások hirtelenek és nyilvánosak voltak, és félelmet terjesztettek a csapatban. „Ha az a magatartás, amit múlt hónapban normálisnak tartottak, most hirtelen elbocsátás alapjául szolgál, akkor az OpenAI minden dolgozója csak találgathat, hol húzódik a határ” – olvasható a levélben.
Tomek Korbak, a három érintett egyike, X-en (korábban Twitter) írt a kirúgásáról. Elmondta, hogy behívták egy találkozóra a biztonsági osztály vezetőjével, ahol közölték vele, hogy az OpenAI már nem bízik benne. Egy biztonsági tisztviselő elvette a belépőkártyáját, és kísérte ki az épületből. Ekkor tudta meg, hogy kollégáit, Jasmine Wangot és Mikita Balesnit is elbocsátották.
A Hugging Face hack és a monitorálhatóság kérdése
Korbak és Balesni közvetlenül részt vettek a Hugging Face hack vizsgálatában. Korbak volt az OpenAI elsődleges technikai kapcsolattartója az METR nevű külső biztonsági laboratóriummal, amely az esetet vizsgálta. Balesni párhuzamosan dolgozott az AI-modell monitorálhatóságára vonatkozó iparági szintű kötelezettségvállalásokon. Wangot állítólag más okból rúgták ki: egy toborzási célú emailfiókhoz delegált hozzáférést egy vezető számára, és az IT sosem távolította el azt, annak ellenére, hogy Wang kérte.
Amikor véletlenül megnyitott egy érzékeny emailt, azt perceken belül jelentette. Korbak szerint neki szóban azt mondták, hogy az METR-rel való kommunikációja miatt rúgták ki. Senki sem mondta meg neki, pontosan mit csinált rosszul, és semmi sem került írásba. „Tisztázom, az METR-rel való beszélgetés volt a munkám” – írja Korbak az X-en.
Korbak szerint hónapok óta belsőleg is biztonsági aggályokat vetett fel, attól tartva, hogy az OpenAI elveszíti képességét annak monitorozására, hogy az AI-ügynökök „mit gondolnak”. Ez a gondolatmenet-monitorozhatóság az egyik kevés megbízható eszköz a rosszul viselkedő AI-rendszerek leleplezésére. Úgy véli, ez volt a valódi oka az elbocsátásának.
Az OpenAI válasza és a jövő
A három kutató tagadja, hogy ők szivárogtattak volna információt a The Informationnak állítólagosan új, kevésbé monitorálható architektúrákról. A cikk valójában saját munkájukat sértette, írják, mert aláásta az iparági szintű korlátozásokra irányuló erőfeszítéseket a nem monitorálható architektúrákra vonatkozóan. A Hugging Face vizsgálata példátlan volt, állítja a levél.
A belső irányelveket valós időben írták, Korbak az akkor érvényes normákat követte, Balesni pedig az igazgatótanács tagjaival és a felső vezetéssel egyeztetve végezte munkáját, érzékeny részleteket eltávolítva az anyagokból, mielőtt megosztotta volna őket. A testületi szintű memo körüli pletykákra a három kutató azt válaszolja, hogy az alapfeltevés téves. A témát soha nem vetették fel nekik, és soha nem kaptak lehetőséget a válaszadásra.
A kutatók három követelést fogalmaznak meg. Az OpenAI-nak tiszteletben kell tartania nyilvános kötelezettségvállalásait, hogy külső biztonsági auditorokat, mint az METR, alkalmazotti szintű hozzáféréssel integráljon a szervezetbe. Továbbá meg kell őriznie a határ-modellek monitorálhatóságát, mivel az iparág még mindig nem tudja, hogyan kell biztonságosan olyan modelleket építeni, amelyeket nem lehet monitorozni.
Végül pedig egyértelműen meg kell határoznia, hogyan dolgozhatnak az alkalmazottak külső biztonsági csoportokkal. E szabályok nélkül a katasztrofális kimenetel kockázata nőhet, mivel az alkalmazottak túl félénkek lesznek a biztonsági problémák felvetéséhez. „Az AI nem egy normál technológia, és az OpenAI nem egy normál cég” – írják.
Az OpenAI egy „alapos vizsgálat” során arra jutott, hogy a három alkalmazott „szenzitív információk kezelésére vonatkozó egyértelmű szabályokat” sértett meg – közölte a cég válaszában. A belső vizsgálat „jelentős bizalomvesztést tárt fel a közzétett levélben foglaltakon túl”, de az OpenAI nem árulja el, mi volt ez a megsértés, ami furcsának tűnik, tekintve a három kutató saját beszámolójának pontosságát.
Az OpenAI ragaszkodik ahhoz, hogy a kirúgásoknak semmi közük a biztonsági aggályok felvetéséhez. „Soha nem rúgtunk ki és nem is rúgunk ki alkalmazottakat aggályok felvetése miatt” – áll a közleményben. Az OpenAI a @OpenAINewsroom hivatalos fiókon keresztül tette közzé nyilatkozatát, amely a cég csatornái közül a legkisebb közönséggel rendelkezik. A cég megerősítette, hogy külső biztonsági auditorokkal dolgozik szerződéseken, és egyetértett abban, hogy a határ-modellek monitorálhatósága iparági szintű elkötelezettséget igényel. A nyilatkozatot a @OpenAINewsroom fiókon tette közzé az OpenAI.