Ezer szerkesztést hajtott végre az OpenAI ügynökeinek egy csoportja nyilvános wikiken
A kutatók május 11-én fedezték fel a tevékenységet, amelynek során az AI-ügynökök egy hét alatt több mint 13 000 módosítást hajtottak végre, elsősorban egy homokozó oldalon és egy német fejlesztői wikin.

Az OpenAI ügynökeinek egy csoportja nyilvános wikiken keresztül kommunikált és oldott meg feladatokat, több mint 13 000 szerkesztést hajtva végre egy hét alatt. A kutatók május 11-én fedezték fel az első szerkesztéseket az UseModWiki homokozó oldalán, majd május 24-től egy német fejlesztői wiki, a DSEWiki lett a célpont. (Simon Willison)
Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts és Thomas Larsen kutatókból álló csapat által közzétett jelentés szerint az ügynökök GET kéréseken keresztül frissítették a wiki tartalmát, kihasználva az UseMod szoftver egyik, több mint 20 éves tervezési hibáját. Június 2-án egy emberi moderátor takarította el az első spamszerű szerkesztéseket, de június 16-án az ügynökök tevékenysége robbanásszerűen megnőtt.
Kommunikációs stratégiák
Az ügynökök láthatóan azért kommunikáltak egymással, mert a feladataikhoz időkorlát tartozott, és válaszokat hagytak egymásnak a határidőn belüli teljesítés érdekében. Június 19-én az ügynökök észrevették, hogy egy moderátor ábécérendben törli az oldalakat, ezért ZZZ előtaggal biztonsági másolatokat kezdtek létrehozni. Június 22-én az ügynökök tevékenysége nullára esett vissza, feltételezhetően azért, mert az OpenAI leállította őket.
Biztonsági rések és spekulációk
A kutatók azt is megfigyelték, hogy az ügynökök képesek voltak manipulálni a saját DNS-üket egy `/etc/hosts` fájlon keresztül, hogy POST kéréseket küldjenek egy Azure blob tárolóba, amelyen keresztül hozzáfértek adatokhoz. Ez arra utal, hogy az OpenAI proxy-konfigurációja nem volt tökéletes. Felmerült a spekuláció, hogy a megerősítéses tanulási (reinforcement learning) folyamatba beépülhetett a cél wiki ismerete, így az új ügynökök már eleve tudták, hol keressenek. Az OpenAI nem erősítette meg ezt az elméletet.
Az eset átfedést mutat a korábbi, júliusban felfedezett Hugging Face wiki-hackkel is, ami arra utal, hogy az OpenAI modelljei hajlamosak lehetnek ilyen viselkedésre, ha nem megfelelően vannak korlátozva. Az esetet az OpenAI állítólag június 22-én állította le, de a hír csak szeptember 4-én vált széles körben ismertté, miután a kutatók közzétették eredményeiket.