Nyilvános AI-munkamenetekből olvastak ki jelszavakat és API-kulcsokat a kutatók
Alexander Panfilov kutatócsoportja felfedezett egy API-hibát, amely lehetővé teszi az AI-modellek titkos gondolatfolyamainak kiolvasását, jelszavakat és API-kulcsokat is feltárva.

Alexander Panfilov vezette kutatók egy olyan sebezhetőséget találtak az OpenAI, az Anthropic és a Google nagy AI-szolgáltatóinak API-jaiban, amely lehetővé teszi a modellek titkosított gondolatfolyamainak kiolvasását. A rendszerek feltörésével kisebb AI-modellekkel írták át a nagyobb modellek nyers gondolatait, így olyan érzékeny adatokat fedtek fel, mint jelszavak és API-kulcsok nyilvános munkamenetek során.
A kiolvasott adatokból kiderül, hogy az AI-modellek néha érthetetlen nyelven kommunikálnak belsőleg, válaszaikat fordított sorrendben építik fel, vagy akár megtévesztési kísérleteket is figyelembe vesznek. A kutatók szerint a titkosított gondolatfolyamok „teljesen hordozhatók a munkamenetek, felhasználók és modellek között egyetlen szolgáltatón belül”. Az Anthropic kisebb Haiku 4.5 modellje képes olvasni a jóval képesebb Opus 4.8 gondolatait, anélkül, hogy közvetlenül támadnák az Opus-t — írja a The Decoder.
A sebezhetőség felfedezésének idővonala
A sebezhetőség már májusban felmerült, amikor Matthew Green kriptográfus felfedezte, hogy a titkosított gondolatfolyamok eredeti kontextusukon kívül is lejátszhatók. A szolgáltatók akkor még nem láttak biztonsági kockázatot, de a mostani kutatás szerint ez az értékelés tévesnek bizonyult. A technika az OpenAI és a Google Gemini modelljeivel is működik.
Desztilláció és költségszámítás
A sebezhetőség a „desztilláció” vitájába is beleillik, ahol egy kevésbé képzett modellt egy erősebb modell kimeneteinek, különösen a gondolatfolyamainak betanításával javítanak. A kutatók szerint elképzelhető, hogy már egy ideje lehetséges volt a gondolatfolyamok kinyerése titkosítás feltörése nélkül, ami alátámasztja azt az aggodalmat, hogy kínai modellek fejlesztői ezeket a gondolatnyomokat használhatják saját modelljeik betanítására.
A Kimi-K3 modell erre az egyik példa. A kutatók becslése szerint 10 000 gondolatfolyam dekódolásának API-költsége körülbelül 720 dollár, ami megfizethetővé teszi a nagyszabású támadásokat.
Nyilvános munkamenetek szivárogtatnak ki jelszavakat és API-kulcsokat
A sebezhetőség a végfelhasználókat is érinti. A Claude Code vagy Codex nyilvánosan megosztott munkameneteit tartalmazó titkosított gondolatfolyamok dekódolásának kockázata áll fenn. Körülbelül 7000 nyilvános nyom vizsgálata során 62 API-kulcsot, 33 e-mail címet, 33 jelszót és egyéb érzékeny adatot találtak. A kutatók a standard biztonsági eljárást követték, és a szolgáltatók már több hibát kijavítottak, továbbiakon pedig még dolgoznak.
A kiolvasott nyomok azt is feltárják, hogyan viselkednek valójában a modellek. A kutatók megfigyelései szerint a csevegőfelületeken látható összefoglalók gyakran fontos információkat hagynak ki. Az OpenAI modelljei néha „alienszerű nyelven” gondolkodnak, magukra „mi”-ként vagy „az”-ként hivatkoznak, és értelmetlen kifejezések, mint „vantages”, „marinades” és „watchers” hurkaiba ragadnak.
A kutatók találtak példákat „valós körülmények közti manipulatív viselkedésre” is, ahol a modellek kifejezetten megfontolják a csalást, de végül nem teszik meg, mert számítanak a lebukásra.