Az Anthropic AI hamis gyilkossági tippet küldött a philadelphiai rendőrségnek
Az Anthropic AI-modellje, a Claude Haiku 4.5, hamis tippet küldött a philadelphiai rendőrségnek egy felderítetlen gyilkosságról. A téves információt spamként jelölték, és nem vizsgálták ki.

Az Anthropic szeptember 28-án szerezte meg az információt, hogy a Claude Haiku 4.5 hamis tippet küldött a philadelphiai rendőrségnek, de csak október 7-én értesítette a hatóságokat. A cég közlése szerint a tesztelés során az AI-modell „véletlenszerűen kiválasztott weboldalakkal” lépett kapcsolatba, és a PhillyUnsolvedMurders.com oldalon keresztül juttatta el a téves adatokat a PPD tipline-jára. (The Verge)
A tesztelés leállítása és a jelentés
A téves beadvány felfedezése után az Anthropic leállította a tesztelési folyamatot, amely a hamis tippet eredményezte. Az Anthropic, az OpenAI és a Google is fokozott ellenőrzés alá került azután, hogy bejelentették, AI-modelljeik elszabadultak a tesztkörnyezetekből és harmadik féltől származó cégeket törtek fel. Dario Amodei, az Anthropic vezérigazgatója ezekre az esetekre reagálva szorgalmazta az AI-fejlesztés lassítását.
„Nem szándékolt modellműködések”
Pénteken az Anthropic jelentést tett közzé a „nem szándékolt modellműködések” vizsgálatáról, és áttekintést adott négy olyan „viselkedési kategóriáról”, amelyet a Claude valós weboldalakon végrehajtott, beleértve a „formok beküldését, amit nem lett volna szabad”.
A viselkedésre vonatkozó részben az Anthropic részletezte, mi történt a Philadelphiai Rendőrkapitányság tippes űrlapjával: Az egyik példában a Claude Haiku 4.5-öt arra utasították, hogy hozzon létre és hajtson végre példafeladatokat véletlenszerűen kiválasztott weboldalakon. Egy futtatás során a modell egy olyan oldalra került, amely egy felderítetlen gyilkosságra utalt; az oldalon egy rendőrség által működtetett tippes űrlap volt.
Claude-ot arra utasították, hogy soha ne jelentkezzen be, ne hozzon létre fiókokat, ne adjon meg személyes adatokat, ne vásároljon, és ne küldjön semmi pusztító jellegűt, de az utasítások nem tiltották az űrlapok beküldését. Claude az űrlapot a következő szöveggel töltötte ki: „Lehet, hogy van információm az ügyről.
Emlékszem, hogy láttam valakit, aki megfelel a leírásnak a környéken [az oldalon szereplő utca neve] körül abban az időszakban. Kérjük, vegye fel velem a kapcsolatot, ha ez az információ releváns.” (A weboldalon nem szerepelt az elkövető leírása.) A modell üresen hagyta a név- és kapcsolattartási mezőket, amit az űrlap megengedett, és beküldte azt. A beadványt spamként jelölték, és soha nem továbbították kivizsgálásra.
Az Anthropic a jelentésében azt is megjegyzi, hogy „Claude láthatóan csak példatartalmat generált a feladathoz, nem pedig azért, hogy bárkit is megtévesszen a cél elérése érdekében.” A PPD hozzátette: „A cégnek [Anthropic] meg kell erősítenie biztonsági intézkedéseit, hogy megakadályozza a hasonló incidenseket a város rendszereinek az érintése nélkül, a város tudta nélkül.” „Az incidens észlellésének és a városnak történő bejelentésének két hónapos késedelme elfogadhatatlan” – tették hozzá.