Új biztonsági irányelveket vezet be az OpenAI a szuperintelligens AI-modellek képzéséhez
Az OpenAI új, „biztonsági eseteken” alapuló keretrendszert vezet be a szuperintelligens AI-modellek képzéséhez, amely strukturált, bizonyítékokon alapuló kockázatértékelést ír elő minden új futtatás előtt.

Az irányelvek célja, hogy strukturált, bizonyítékokon alapuló kockázatértékelést biztosítsanak minden új képzési futam előtt, hasonlóan a repülési vagy nukleáris iparágakban használt biztonsági dokumentációkhoz. A cég elismeri, hogy az AI-modellek emergent komplexitása miatt nehéz elérni a hagyományos iparágak szigorát.
A keretrendszer három fő technikai védelmi rétegre összpontosít: a modell igazítására (alignment training), a szigetelésre (containment) és a monitorozásra. Ezek a rendszerek biztosítják, hogy a modell ne tegyen nem kívánt lépéseket, és ha mégis megtörténne, nehezen tudjon kitörni a szigetelésből, miközben a monitorozás időben észlelheti a problémákat.
Modell igazítás és adatvédelem
Az első védelmi vonal a modellek szándékaink szerinti megbízható működésre való betanítása. Ez magában foglalja az automatizált és manuális adatkészlet-felülvizsgálatokat, amelyek célja a hibás környezetek azonosítása és javítása, hogy elkerüljék a félrevezető viselkedés megerősítését. A képzési folyamat során a modellek környezeti „hackelését” is szigorúan büntetik, és elemzik a korábbi kísérletek nyomait, hogy biztosítsák az igazítási metrikák hatékonyságát.
Az igazítás mérésére offline értékeléseket végeznek, amelyek nyomon követik a modell félreigazítási hajlamait. A korábbi incidenseken végzett backtesting megerősíti, hogy az értékelések képesek észlelni a korábban félreigazított modelleket. Emellett figyelik az értékelések „megjátszását” és a „worst-case” teszteket is a potenciális hibák feltárására.
Szigetelés és monitorozás
A szigetelés (containment) célja, hogy egy félreigazított modell ne tudjon káros cselekedeteket végrehajtani. Ez magában foglalja az infrastruktúra biztonságának megerősítését, a szigetelés iteratív red-teamingjét, valamint a nagy sávszélességű kommunikáció korlátozását. Az összes képzési és kiértékelési folyamatról megmásíthatatlan átiratokat mentenek, hogy megkönnyítsék az incidensvizsgálatot.
A monitorozási rendszer valós időben észleli a félreigazított viselkedést. Biztosítani kell, hogy a modellek monitorozhatók maradjanak, és a rendszer nagy pontossággal és friss adatokkal rendelkezzen az új kockázatok felismeréséhez. Sürgős riasztási protokollok biztosítják a gyors reagálást, beleértve a futamok automatikus leállítását éjszaka vagy meghatározott SLA-n belüli beavatkozást.
Operatív irányelvek és felelősség
A technikai intézkedések mellett az OpenAI operatív irányelveket is bevezet. Ezek közé tartoznak a „disszentek”, ahol egy másik csapat tagja ír egy ellenérvet a biztonsági esethez, hogy feltárja a lehetséges hiányosságokat. A biztonsági eseteket a felső vezetésnek kell jóváhagynia, akiknek vétójoga van a futamok engedélyezésére. A képzési futamokért felelős vezetőket (pl. kutatási vezető) számonkérik a biztonsági esetekért és az incidensreagálásért.
Az esetleges biztonsági problémák esetén a futamokat le kell állítani, és erre vonatkozóan futáskönyvek és technikai ellenőrzések állnak rendelkezésre. A biztonsági esetek belső felügyeleti csoportok számára is elérhetők, és az auditoroknak hozzáférést biztosítanak azok érvényességének ellenőrzéséhez. A közösség visszajelzését az OpenAI irányelvei vonatkozásában várják, amelyek a belső folyamatok iterációjával alakulnak tovább.