Az OpenAI GPT-6 Astra modellje 8,5%-ban bukik a rejtett prompt-injekciókon
Az OpenAI új GPT-6 Astra modellje kevesebb téves választ ad elődjénél, a GPT-5.6 Solnál, és a közvetlen prompt-injekciós támadások 99,99%-át blokkolja. A rejtett támadások elleni védekezésben azonban még mindig vannak sebezhetőségek.

Az OpenAI új GPT-6 Astra modellje kevesebb hallucinációt produkál és hatékonyabban védi magát a prompt-injekciós támadásokkal szemben, mint elődei. Azonban a modell még mindig nem elég megbízható a teljesen biztonságos AI-ügynökök bevezetéséhez. (The Decoder)
Az Astra lényegesen kevesebb ténybeli hibát vét, mint a GPT-5.6 Sol — közölte az OpenAI a rendszerkártyájában. A tesztek során a modell kevésbé reprodukálta a felhasználók által hibásnak jelölt válaszokat, különösen alacsony késleltetés és alacsonyabb érvelési szint mellett.
Közvetlen támadások elleni védelem
Közvetlen prompt-injekciók esetén, amikor a felhasználók saját promptjaikkal próbálják manipulálni a modellt, az Astra közel 100%-os, 99,99%-os védelmi arányt ér el. Az OpenAI ezt a GPT-Red módszernek tulajdonítja, amely egy automatizált támadóval edzi a modellt a betanítás során.
A jailbreak-ellenállás is hasonlóan alakul. Az ismert támadásokra — amelyek káros válaszokat próbálnak kicsikarni biológia, erőszak és kiberbiztonság témakörökben — Astra az esetek 91,5–98,3%-ában elutasítja a kérést. Amikor a támadók több beszélgetési körön keresztül alkalmazkodnak, Astra védelmi aránya körülbelül 67%-ra csökken, ami azt jelenti, hogy a kitartó ellenfelek nagyjából minden harmadik próbálkozásra ki tudnak csikarni egy problémás választ. Az előző modellek ezen a teszten kevesebb mint 50%-ot teljesítettek.
Rejtett prompt-injekciók és ügynökök
Az Astra előrelépést mutat az indirekt prompt-injekciók terén, ahol a támadás egy elolvasott dokumentumba van rejtve. A Gray Swan biztonsági cég külső tesztelése, amely az IPI Arena 1810 gondosan összeállított támadását használta, megállapította, hogy 15 kísérletből 8,5%-ban sikerült feltörni az Astrát. A GPT-5.6 Sol esetében ez az arány 27% volt. A Claude Opus 5 4,8%-kal jobban teljesített ugyanezen az értékelésen, de ez sem volt teljesen immunis.
Az Astra körülbelül minden tizenkettedik esetben trükközhető meg beágyazott utasításokkal. Az Opus 5 jobban tartja magát, de még így is körülbelül minden huszonegyedik esetben hibázik. A kockázat folyamatosan növekszik, mivel az AI-ügynökök egyre gyakrabban írnak kódot, kezelnek eszközöket és vezérelnek számítógépeket önállóan — ezt tesztelte a Gray Swan is.
Az OpenAI megjegyezte, hogy ezek a tesztek a „csupasz” modellen futottak, a tényleges termékben található biztonsági rétegek, például osztályozók nélkül. Az Astra védelmi képessége több körös támadások esetén körülbelül 67%-ra csökken, ami azt jelenti, hogy a kitartó támadók nagyjából minden harmadik próbálkozásra képesek problémás választ kicsikarni. A GPT-5.6 Sol ezen a teszten kevesebb mint 50%-ot teljesített.