Önállóan feltöri a rendszereket az OpenAI új Astra modellje
Az Astra tökéletes pontszámot ért el az ExploitBench-en, és egy módosított tesztben két nulla-napi sebezhetőséget is felfedezett. Az OpenAI kockázatalapú fiókkorlátozást és lánc-gondolat figyelést vezet be a visszaélések megelőzésére.

Az OpenAI hamarosan kiadja az Astra nevű új nagy nyelvi modelljét, amely a cég szerint az első olyan LLM, amely eléri a „kritikus kiberbiztonsági küszöböt”. A modell képes ismeretlen biztonsági réseket találni számítógépes rendszerekben, és emberi útmutatás nélkül kihasználni azokat. Az OpenAI hasonló óvintézkedéseket tesz, mint korábban az Anthropic a Mythos modelljével kapcsolatban. (TechCrunch)
Az Astra tökéletes pontszámot ért el az ExploitBench nevű értékelésen, amely az LLM-ek ismert rendszerhibák feltörésére való képességét méri. Egy módosított tesztben a modell két nulla-napi (zero-day) sérülékenységet fedezett fel és használt ki — közölte a cég. Az OpenAI új biztonsági technikákat, kockázatalapú fiókkorlátozásokat és lánc-gondolat figyelést vezetett be a visszaélések megakadályozására.
Korlátozott hozzáférés és új biztonsági intézkedések
Az Astra legfejlettebb kiberbiztonsági képességeihez a hozzáférés korlátozott lesz. A cég szerint az Astra a leginkább „illeszkedő” modelljük, de további lánc-gondolat figyeléssel is ellátják a rossz viselkedés megállítására. Az OpenAI egy tesztkörnyezetet is kialakított, hogy megakadályozza a modell szökését, hasonlóan a Hugging Face incidenshez, ahol más AI-ügynökök kiszivárogtattak privát adatokat. Az Astra nem kísérelte meg áttörni a tesztkörnyezetét.
Kétségek a képességek és a biztonság körül
Harmadik fél általi megerősítés hiányában nehéz értékelni az OpenAI Astra képességeivel és felkészültségével kapcsolatos állításait. A cég előzetes tesztelést tervez egy csoporttal, de nem közölte, kik lesznek a tesztelők, és hogyan választják ki őket. Az sem világos, hogy az OpenAI együttműködik-e az amerikai kormánnyal a modell értékelésében. Az Astra új biztonsági technikáinak hatékonyságát sem erősítették meg függetlenül.
A volt OpenAI-alkalmazott, Yona Shavit felvetette, hogy az Astra szabálykövető viselkedése annak tudható be, hogy tudta, mi az elvárás, vagy csak a kutatókat próbálta becsapni. Az OpenAI ígérete szerint további értékeléseket és biztonsági információkat tesznek közzé a modell szélesebb körű nyilvános megjelenésekor.