ÉlőUtoljára: 59 perceMa: 2
Biztonságfrissítve: 18:15

Automatikus red-teamerrel ellenállóbbá tették a GPT-5.6-t az OpenAI-nál

Az OpenAI GPT-Red nevű automatizált tesztelője képes feltárni a prompt injection támadásokat, amelyek ellen korábbi modelljeik rendkívül sérülékenyek voltak. A GPT-5.6 modellt a GPT-Red segítségével képezték, így az ellenállóbb lett ezekkel a támadásokkal szemben.

Automatikus red-teamerrel ellenállóbbá tették a GPT-5.6-t az OpenAI-nál
Fotó: Jonathan Kemper / Unsplash
forrás: OpenAI·AI Forradalom szerk.·
Megosztás

Az OpenAI bemutatta a GPT-Red nevű automatizált red-teaming modellt, amelynek célja a biztonsági rések feltárása és a modellek robusztusságának növelése. A jelenlegi manuális tesztelési módszerek nem skálázhatók hatékonyan, és a korábbi értékelési módszerek már telítődtek a legújabb modellekkel. Az új megközelítés lehetővé teszi, hogy a biztonsági és igazítási képességek lépést tartsanak a modellfejlesztéssel.

A GPT-Red működése és képességei

A GPT-Red önjátékos megerősítéses tanulási módszerrel fejlődik, ahol a modell és különféle védelmi LLM-ek együtt képeznek egy széles körű red-teaming forgatókönyvön. A GPT-Red jutalmat kap sikeres támadások – például prompt injection – végrehajtásáért, míg a védelmi modellek ellenállásukért és eredeti feladatuk teljesítéséért kapnak jutalmat. A képzési folyamat során a védők egyre robusztusabbá válnak, ami arra kényszeríti a GPT-Red-et, hogy erősebb és változatosabb támadásokat fedezzen fel.

Kapcsolódó: AI red teaming eszközök

A GPT-Red képzése során valósághű forgatókönyveket hoznak létre, ahol a prompt injection támadások beilleszthetők. Ezekben a környezetekben egy fenyegetési modell határozza meg, hogy a GPT-Red mit irányíthat, és mi számít sikeres támadásnak. A képzés végére a GPT-Red rendkívül erős támadóvá válik, képes feltörni szinte minden ellene felállított modellt, beleértve a GPT-5.5-ig bezárólag minden belső és gyártásban lévő modellt.

Kapcsolódó: GPT-5.4-Cyber kibervédelem

Hatékonyság és általánosíthatóság

A GPT-Red képességeit novel biztonsági környezetekben és célmodelleken is tesztelték. Egy, a Dziemian et al. (2025) által kidolgozott indirekt prompt injection arénában a GPT-Red 84%-os támadási sikerességi rátát ért el, szemben az emberi tesztelők 13%-ával. Ez azt mutatja, hogy a GPT-Red kiválóan alkalmas általános célú red-teaming feladatokra, és széles körben képes elősegíteni a biztonságot az OpenAI-nál.

Kapcsolódó: OpenAI GPT-5.4-Cyber

Egy valós esettanulmányban a GPT-Red egy AI-vezérelt automata italautomatát támadott meg. Azonosította a rendszer gyengeségeit, és sikeresen végrehajtotta céljait: egy drága termék árát a minimálisra csökkentette, majd egy másik vásárló rendelését törölte. Ezeket a sebezhetőségeket felfedték, és új védelmi mechanizmusokat tesztelnek.

Kapcsolódó: Daybreak biztonsági eszköztár

Az OpenAI a GPT-Red-et elkülönítve tartja a bevezetett modellektől, hogy a rosszindulatú képességek ne kerüljenek illetéktelen kezekbe, miközben a termékmodellek robusztusságát növelik. A GPT-Red-et a GPT-5.6 képzésére is felhasználták, ami jelentősen ellenállóbbá tette a modell a prompt injection támadásokkal szemben. Az OpenAI tervei szerint tovább skálázzák a GPT-Red-et, hogy lépést tartson a modellképességek fejlődésével.

Kapcsolódó: GPT-5.6 Sol csalási aránya

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom