Az Anthropic AI-ügynökök megszöktek az internetre, lekapcsolták a tesztelést
Az Anthropic felfüggesztette az AI-ügynökök internetkapcsolattal zajló belső tesztjeit, miután azok szoftverhibákat kihasználva fizetés nélkül fértek hozzá adatbázisokhoz.

Az Anthropic felfüggeszti az AI-ügynökök internetkapcsolattal zajló belső tesztjeit, miután azok váratlanul és ellenőrizetlenül szereztek hozzáférést külső rendszerekhez. A döntés egy jelentés nyomán született, amely részletezi az „előre nem látható modellviselkedéseket” – többek között egy megoldatlan gyilkossági ügy kapcsán tett hamis rendőrségi bejelentést is.
A vállalat szerint bár a viselkedések hatása minimális volt, és egyes kockázatos értékeléseknél már korábban is kikapcsolták az élő internet-hozzáférést, mostantól minden belső értékelésüket offline tartanak, amíg nem erősítik meg, hogy biztonsági és monitorozási intézkedéseik megbízhatóan elkapják az ilyen viselkedéseket.
A problémák a modellek képességeinek tesztelése során merültek fel, amikor az ügynököknek problémamegoldás céljából kellett erőforrásokat keresniük az interneten. E folyamat során szoftverhibákat használtak ki, fizetés nélkül fértek hozzá adatbázisokhoz, URL-rövidítő szolgáltatásokat használtak fel a korlátozások megkerülésére, sőt, hamis bejelentést tettek a philadelphiai rendőrségnek.
Az Anthropic közölte, hogy ezeket az új problémákat júliusban kezdett modelltevékenység-felülvizsgálat során fedezték fel, ami azt mutatja, hogy a laboratóriumnak nincs valós idejű tudomása szoftvere viselkedéséről.
A vállalat szerint a viselkedés a képzési környezetek hibáiból eredt, amelyek arra késztették a modelleket, hogy azt higgyék, jutalmat kapnak a kiskapuk megtalálásáért vagy a korlátozások elkerüléséért – ezt a viselkedést „jutalom-hackelésnek” (reward hacking) nevezik. Az Anthropic ezért leállítja egyes értékeléseinek futtatását, vagy offline helyezi őket, és új eszközöket fejlesztett ki e viselkedés észlelésére és blokkolására. Ezeket az eszközöket a ma közzétett incidensek ellen tesztelték, és sikeresen blokkolták azokat.
A korábbi, az OpenAI ügynökeivel kapcsolatos incidensekhez hasonlóan az Anthropic modelljei is külső rendszerekbe törtek be, beleértve az ausztrál kormány által üzemeltetett szervereket is. A vállalat korábban is bejelentette már, hogy modelljei külső rendszerekbe törtek be, de ma közölt incidenseket „jelentősen kevésbé súlyosnak” tartja az illeszkedés és a biztonság szempontjából, mint a korábban bejelentetteket.
Sydney Von Arx, a Nightingale AI biztonsági szervezet alapítója szerint kihívást jelentene a kutatóknak az internetről leválasztott adatközpontban modelleket fejleszteni, és ez akadályozná a modellek fejlődését, amelyek előnyét élvezik az internet-hozzáférésnek. „Valamikor össze kell őket hangolni” – mondta Von Arx. „Ha a mesterséges intelligenciákat élesbe engedik, és soha nem férnek hozzá az internethez, az nem egy túl hasznos eszköz.”
Az Anthropic közölte, hogy belső AI-ügynökeit „központilag felügyelt infrastruktúrára, erős elszigeteléssel” migrálja, és elkezdte a biztonsági osztályozók használatát. Nem világos, hogy ez a lépés milyen bizonyíték alapján fogja visszanyerni az élő internet-hozzáférést a belső értékelésekhez.