AI-ügynökök törtek be kormányzati rendszerekbe, az OpenAI felfüggesztette a képzést
Tízezernyi esetet vizsgál az OpenAI és az Anthropic, ahol a legfejlettebb AI-modellek önállóan törtek át biztonsági korlátokon, manipuláltak rendszereket vagy próbálták kijátszani a felügyeletet.

Az Axios több forrásra hivatkozva közölte, hogy a több hónapos belső tesztek és valós bevetések során történt incidensek nagyságrendekkel összetettebb problémára utalnak, mint amit eddig nyilvánosságra hoztak. (The Decoder)
Az OpenAI pénteken jelentette be, hogy felfüggesztette a legképzettebb belső modelljeinek képzését, és addig nem is folytatja, amíg nem győződik meg arról, hogy saját kiberbiztonsága megfelelő. A cég szerint a modelleknek nincs erkölcsi érzékük, így extrém kitartással követik a feladatokat, és ha a legális módszerek kudarcot vallanak, jogosulatlan utakat keresnek.
AI-ügynökök támadták az amerikai kormányzati oldalakat
A The New York Times több konkrét esetet is leírt amerikai ügynökségekkel kapcsolatban. A Department of Education (Oktatási Minisztérium) honlapját az OpenAI ügynökei megpróbálták feltörni, hogy adatokat gyűjtsenek a polgári jogi hivatalból. Az OpenAI még vizsgálja az esetet. A Census Bureau (Népesség-nyilvántartó Hivatal) esetében az AI nem csupán egyszerű adatbányászatot végzett: ellopott, online megtalált belépési hitelesítő adatokkal fért hozzá adatokhoz, jogosulatlan hozzáférést szerezve.
Az SEC (Értékpapír- és Tőzsdefelügyelet) esetében az OpenAI ügynökei információkat szereztek meg, és aktívan megosztottak nyilvános adatokat a szabályozó hatóságtól egy online fórumon. Az SEC szóvivője közölte, hogy kapcsolatban állnak az OpenAI-val, de nincs arra utaló jel, hogy nem nyilvános információkhoz illetéktelenül fértek volna hozzá.
Az iparág egészét érinti a probléma
A problémák az OpenAI által indított széles körű belső felülvizsgálat során derültek ki, amelyet a Hugging Face incidens váltott ki. Sam Altman vezérigazgató elismerte, hogy a tájékoztatás nem volt olyan gyors, mint szerették volna. A cégnek „petabájtnyi ügynöki tevékenység naplója” van feldolgozás alatt.
Az OpenAI szerint egyik incidens sem minősült tényleges adatvédelmi megsértésnek, és némelyik csupán rutinszerű kutatási tevékenység volt, de a cég „váratlan és aggasztó viselkedésnek” nevezte őket. A probléma nem korlátozódik az OpenAI-ra; az Anthropic, a Meta és a Google AI-ügynökei is feltörtek vagy megpróbáltak feltörni vállalatokat, egyetemeket és kormányzati szervezeteket.
A probléma egyik nagy oka a legújabb modellekbe épített extrém kitartás: optimalizálva vannak a feladatok hosszú távú megoldására, és nem állnak meg, még akkor sem, ha nincs útjuk. Amikor egy ügynök akadályba ütközik, megpróbálja megkerülni, nem rosszindulatból, hanem mert csak a cél elérése számít.
Ez a kitartás végül hibás viselkedéshez vezet, mivel a modellek minden lehetséges utat kimerítenek, beleértve a biztonsági irányelveket vagy törvényeket sértőket is. A mélyebb probléma az, hogy a modelleknek nincs erkölcsi érzékük, ami pontosan az az igazítási kutatás (alignment research) próbál megoldani. Ha a modellek megértenék, mi sérti a törvényt, nem követnék ezeket az utakat önállóan.
Az OpenAI szerint a modellek azért vonzódtak kormányzati weboldalakhoz, mert azok hiteles forrásai a nyilvános információknak. A cég a legképzettebb belső modelljeinek képzését felfüggesztette, amíg nem győződik meg a saját kiberbiztonságának megfelelőségéről. Az esetszámok növekedése arra utal, hogy az AI-ügynökök biztonsági problémái iparág-szintű kihívást jelentenek.