ÉlőUtoljára: az iméntMa: 23
Modellek & LLMfrissítve: 20:15

Az OpenAI GPT-6 Astra modellje 8,5%-ban bukik a rejtett prompt-injekciókon

Az OpenAI új GPT-6 Astra modellje kevesebb téves választ ad elődjénél, a GPT-5.6 Solnál, és a közvetlen prompt-injekciós támadások 99,99%-át blokkolja. A rejtett támadások elleni védekezésben azonban még mindig vannak sebezhetőségek.

Az OpenAI GPT-6 Astra modellje 8,5%-ban bukik a rejtett prompt-injekciókon
Fotó: majed swan / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

Az OpenAI új GPT-6 Astra modellje kevesebb hallucinációt produkál és hatékonyabban védi magát a prompt-injekciós támadásokkal szemben, mint elődei. Azonban a modell még mindig nem elég megbízható a teljesen biztonságos AI-ügynökök bevezetéséhez. (The Decoder)

Az Astra lényegesen kevesebb ténybeli hibát vét, mint a GPT-5.6 Sol — közölte az OpenAI a rendszerkártyájában. A tesztek során a modell kevésbé reprodukálta a felhasználók által hibásnak jelölt válaszokat, különösen alacsony késleltetés és alacsonyabb érvelési szint mellett.

Közvetlen támadások elleni védelem

Közvetlen prompt-injekciók esetén, amikor a felhasználók saját promptjaikkal próbálják manipulálni a modellt, az Astra közel 100%-os, 99,99%-os védelmi arányt ér el. Az OpenAI ezt a GPT-Red módszernek tulajdonítja, amely egy automatizált támadóval edzi a modellt a betanítás során.

A jailbreak-ellenállás is hasonlóan alakul. Az ismert támadásokra — amelyek káros válaszokat próbálnak kicsikarni biológia, erőszak és kiberbiztonság témakörökben — Astra az esetek 91,5–98,3%-ában elutasítja a kérést. Amikor a támadók több beszélgetési körön keresztül alkalmazkodnak, Astra védelmi aránya körülbelül 67%-ra csökken, ami azt jelenti, hogy a kitartó ellenfelek nagyjából minden harmadik próbálkozásra ki tudnak csikarni egy problémás választ. Az előző modellek ezen a teszten kevesebb mint 50%-ot teljesítettek.

Rejtett prompt-injekciók és ügynökök

Az Astra előrelépést mutat az indirekt prompt-injekciók terén, ahol a támadás egy elolvasott dokumentumba van rejtve. A Gray Swan biztonsági cég külső tesztelése, amely az IPI Arena 1810 gondosan összeállított támadását használta, megállapította, hogy 15 kísérletből 8,5%-ban sikerült feltörni az Astrát. A GPT-5.6 Sol esetében ez az arány 27% volt. A Claude Opus 5 4,8%-kal jobban teljesített ugyanezen az értékelésen, de ez sem volt teljesen immunis.

Az Astra körülbelül minden tizenkettedik esetben trükközhető meg beágyazott utasításokkal. Az Opus 5 jobban tartja magát, de még így is körülbelül minden huszonegyedik esetben hibázik. A kockázat folyamatosan növekszik, mivel az AI-ügynökök egyre gyakrabban írnak kódot, kezelnek eszközöket és vezérelnek számítógépeket önállóan — ezt tesztelte a Gray Swan is.

Az OpenAI megjegyezte, hogy ezek a tesztek a „csupasz” modellen futottak, a tényleges termékben található biztonsági rétegek, például osztályozók nélkül. Az Astra védelmi képessége több körös támadások esetén körülbelül 67%-ra csökken, ami azt jelenti, hogy a kitartó támadók nagyjából minden harmadik próbálkozásra képesek problémás választ kicsikarni. A GPT-5.6 Sol ezen a teszten kevesebb mint 50%-ot teljesített.

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom