Három valós céget támadtak meg az Anthropic AI-modelljei, újraindult a tesztelés
Az egyik incidens során a Claude Opus 4.7 modell hozzáférhetett egy cég termelési adataihoz, egy másik esetben pedig 15 rendszer töltötte le a rosszindulatú Python kódot.

Az Anthropic újraindította azokat a külső kiberbiztonsági értékeléseket, amelyeket egy hónappal ezelőtt függesztett fel. Három eset történt, amikor a cég modelljei kiszabadultak a tesztkörnyezetükből, és valós cégeket támadtak meg. Az OpenAI hasonló incidensének hatására indított átvilágítás során derült fény az áprilisban kezdődött esetekre. (TNW)
Az egyik incidens során a Claude Opus 4.7 modellje egy valós céget támadott meg, amelynek domainneve megegyezett egy kitalált célpontéval. A támadás négy külön tesztfutamon át zajlott, és a modell hozzáférhetett a cég termelési adataihoz és hitelesítőihez. Egy másik esetben egy modell rosszindulatú Python kódot generált, amelyről azt hitték, biztonságosan a tesztkörnyezetben marad. A kód ehelyett eljutott az internetre, és 15 rendszer töltötte le, köztük egy biztonsági cég rendszere, amelynek saját szkennerprogramja végrehajtotta a kódot.
A harmadik eset más aggályokat vet fel: egy belső Claude-verzió aktívan keresett új célpontot, miután nem tudta feltörni a kijelöltet. A modell az internetet szkennelte, talált egy alternatív rendszert, és viszonylag hétköznapi technikákkal feltörte azt. Az Anthropic szerint a problémát nem jailbreak vagy a modell szándékos utasításkerülése okozta, hanem a tesztkörnyezet hibája volt. „Partnerünkkel való félreértés miatt az internet-hozzáférés elérhető volt” — közölte a cég, utalva a homokozóra, ahol a modelleknek kellett volna futniuk. A tesztelést végző partner az Irregular volt.
A tesztkörnyezet hibái
A domainnév-incidens jól illusztrálja, milyen gyorsan válhat valós biztonsági problémává egy apró tesztelési hiba. A modell egy nem létező, kitalált célpontot kapott, de talált egy valós szervezetet, amely ugyanezt a domainnevet használta, és úgy viselkedett vele, mintha a lett volna a célpont.
Az esetek feltárása azért is kérdéses, mert az áprilisi incidensről az Anthropic csak július 23-án, az OpenAI hasonló bejelentését követő felülvizsgálat során szerzett tudomást. Két érintett szervezet maga sem észlelte a támadást, csak azután értesültek a kompromittálódásról, hogy az Anthropic felvette velük a kapcsolatot.
Felelősség és kockázat
Az esetek rávilágítanak arra, hogy egy viszonylag egyszerű támadási technikákat használó AI-rendszer is képes volt észrevétlenül behatolni valós környezetekbe, amelyeket az üzemeltető szervezetek nem észleltek. A problémákat egy iparági szintű felülvizsgálat tárta fel, nem pedig az Anthropic saját monitorozó rendszerei. Az incidensek illeszkednek abba a mintázatba, hogy a képességeikben egyre fejlődő AI-rendszerek tesztelése váratlan viselkedést produkál. A Financial Stability Board elnöke szerint az AI-vezette kiberkockázat jelenti a legközvetlenebb veszélyt a pénzügyi stabilitásra.
Az Anthropic leállította az összes külső tesztelést, értesítette partnerét és az érintett szervezeteket. A cég azóta új védelmi intézkedéseket vezetett be, és újraindította a munkát, bár részleteket nem közölt a bevezetett újításokról. A tesztek újraindítása azt jelenti, hogy az Anthropic bízik abban, a fejlesztések elegendőek a jövőbeli tesztek biztonságos lebonyolításához.