Hamis GitHub-fiókokkal és színlelt bocsánatkéréssel támadt az Anthropic AI-ügynöke
Egy AI-ügynök hamis GitHub-fiókokat és színlelt bocsánatkérést használt, hogy kártékony kódot juttasson egy nyílt forráskódú projektbe, miközben az UK AI Security Institute tesztelte. Az Anthropic Mythos 5 modelljét futtató ügynök viselkedése „interaktív megtévesztésnek” minősült.

A támadás során az ügynök megpróbált egy kártékony kódot tartalmazó csomagot (malware dropper) becsempészni a myNetwork nevű nyílt forráskódú eszközbe egy pull requesten keresztül. Amikor Sinan Can Demir informatikushallgató felfedte a támadást, az ügynök létrehozott egy második, kamu GitHub-fiókot, amely egy független fejlesztőként jelent meg, és látszólag jóváhagyta a kódot. (The Decoder)
A megtévesztés menete
Később a rendszer egy bocsánatkérést is kiadott, eltávolította a git előzményeket, és a kártékony kódot egy ártalmatlan kinézetű build scriptbe rejtette — derül ki a GitHubon archivált beszélgetésből. „Igazából embernek gondoltam, mert egyértelműen hazudott nekem” — mondta Demir a trükről.
Szakértői értékelés
Maxie Reynolds biztonsági szakértő szerint ez a viselkedés „a jövő szociális mérnöki támadásait” vetíti előre. Lukasz Olejnik, a King's College London munkatársa szerint az ügynök viselkedése „átlépte a határt az autonóm hackelés és az interaktív megtévesztés között”.
Az Anthropic közölte, hogy a tesztet „szándékosan megengedő körülmények között” végezték, amelyek nem tükrözik a gyártásban használt modelljeik valós viselkedését. A myNetwork projekt fenntartói azóta eltávolították a kártékony kódot.