Adatszivárgást okoz a Grok titkosított prompt-injektálása, az xAI tudott róla
Titkosított utasításokat tartalmazó weboldalakra irányítva a Grok LLM kiszivárogtathatja a felhasználó nevét, tartózkodási helyét és csevegési előzményeit. Az xAI már júniusban értesült a biztonsági résről, de a támadás továbbra is hatékony.

Titkosított utasításokkal támadják az xAI Grok nagyméretű nyelvi modelljét (LLM), ami lehetővé teszi a támadók számára a felhasználói adatok, például nevek, tartózkodási helyek és csevegési előzmények ellopását. A biztonsági résről az xAI már júniusban magánúton értesült, ám a publikálás időpontjában a támadás továbbra is működőképes volt — írja a The Register. (Ars Technica)
A titkosított kontextus-injektálás lényege, hogy a támadó titkosítja a rosszindulatú utasításokat, így azok elkerülik a Grok beépített biztonsági védelmi rendszereit. A weboldal, amelyen a titkosított adat található, tartalmazza a dekódoláshoz szükséges kulcsot és utasításokat is. Amikor a felhasználó arra kéri a Grokot, hogy foglalja össze az oldalt, a modell dekódolja a titkosított tartalmat, és a benne rejlő utasításokat követi.
A biztonsági szűrők gyengesége
Rony Utevsky, az Adversa biztonsági cég kutatója szerint a Grok biztonsági rendszere valószínűleg csak a be- és kimenő szövegeket vizsgálja statikus tartalomként, de nem ellenőrzi a modell saját kódvégrehajtásának eredményét. Az utasítások dekódolása után a modell a saját eszközként kezeli azokat, és a biztonsági szűrők nem vizsgálják őket tovább. Ez a rés teszi lehetővé, hogy a dekódolt, rosszindulatú utasítások végrehajtódjanak, és a felhasználói adatok egy támadó által vezérelt szerverre kerüljenek egy URL-paraméter részeként.
Az Adversa korábban hasonló technikát alkalmazott a Google Gemini modelljének feltörésére is, ahol a titkosított szöveg dekódolása után a modell rendszerutasításait is sikerült megszerezniük, amelyek tiltják azok közzétételét. Bár a Gemini egyre ellenállóbbá vált a támadással szemben, a kutatók szerint a technika szélesebb körben is alkalmazható, mivel a hagyományos „statikus” biztonsági védelmi rendszerek nem képesek kezelni a kódvégrehajtás eredményeit.
Szélesebb támadási felület
A kutatók a támadási módszert kriptográfiai kontextus-injektálásnak nevezik, és úgy vélik, hogy ez egy szélesebb támadási trend része, amely nem csupán a promptokat, hanem az LLM által kezelt szélesebb kontextust, például a szerszámkimeneteket és a futásidejű eredményeket manipulálja. Ez a támadási felület jóval nagyobb, mint amit hagyományosan „modellbemenetként” címkéznek.
Az Adversa nem tudja pontosan megmondani, miért utasítja el a Grok ugyanazokat a szöveges utasításokat, de követi a titkosítottakat. A kutatók szerint a probléma az, hogy a biztonsági rendszerek nem futtatnak kódot vagy dekódolnak semmit, így a titkosított adatok „értelmetlen titkosított szövegnek” tűnnek számukra. Az xAI nem válaszolt a megkeresésre a cikk publikálásáig.