Aggodalmat kelt az OpenAI új rekurzív mélység technikája a biztonsági szakértőkben
Az OpenAI Astra modelljének új rekurzív mélység technikája aggodalmat kelt a biztonsági szakértőkben, mivel nehezebbé teszi a modell gondolatmenetének követését.

Az OpenAI új Astra modellje a „rekurzív mélység” nevű érvelési technikát használja, amely lehetővé teszi a modell számára, hogy a legtöbb érvelési modellre jellemző szekvenciális gondolkodáson kívül működjön – jelentette a The Information kedden. Ez az „opacitásos rekurrencia” néven is ismert technika valószínűleg megnehezíti a modell gondolatmenetének követését, ami aggodalmat kelt az AI-biztonsági szakértőkben. (TechCrunch)
Bár az Astra e technika használata állítólag korlátozott, megjelenése így is jelentős aggályokat vetett fel. „Rendkívül aggódom az Astra által alkalmazott opacitásos rekurrencia miatt” – írta Buck Shlegeris, a Redwood vezérigazgatója egy bejegyzésben. „Nem tudom, hogy az Astra kevésbé követhető-e a láncolat-gondolat (CoT) szempontjából, mint a korábbi modellek. De ha az OpenAI tovább fejleszti ezt a technikát, lehetőségük lesz drasztikusan növelni a rekurrenciát, és teljesen tönkretenni a CoT követhetőségét.”
A hosszú ideje az AI-biztonságért küzdő Zvi Mowshowitz is megszólalt, és törvényi szabályozást sürgetett egy „verseny a legrosszabbra” elkerülése érdekében. „A technika tűzzel játszik, kockáztatva egy tabut, amelyet az OpenAI és az Anthropic is igyekezett létrehozni, hogy mi a lehető leghosszabb ideig fenntartsuk a láncolat-gondolat hűségét és követhetőségét” – írta Mowshowitz. „Az ilyen technikák intenzívebb használata valószínűleg rontana a követhetőségen.”
Normál körülmények között egy érvelési modell láncolat-gondolata a modell által egy probléma megoldására tett szekvenciális lépéseket mutatja. Bár a reprezentáció tökéletlen, továbbra is értékes eszköz a helytelen viselkedés vagy a nem megfelelő igazítás monitorozására.
Az OpenAI közelmúltbeli, nem megfelelő ügynöki tevékenységének esetében a láncolat-gondolat rekordok fontos eszközt jelentettek annak megértésében, miért viselkedtek az ügynökök úgy, ahogy. Az opacitásos rekurrenciában a modell kevésbé lineáris megközelítést alkalmaz, ugyanazt a lekérdezést többször, hurokszerűen dolgozza fel. Az eredmény kevesebb olvasható nyomot hagy, hatékonyan megkerülve a hagyományos láncolat-gondolat rekordot.
Lényeges, hogy az Astra e technika használata látszólag korlátozott. A modell gondolatmenetének továbbra is olvashatónak kell lennie, és a cég elutasított minden olyan javaslatot, amely szerint „neuralese”-re váltanának. Az OpenAI már bejelentette a kiterjedt láncolat-gondolat monitorozási rendszerek terveit, mint előretekintő biztonsági terveinek részét.
Az X-en közzétett bejegyzésében Jakub Pachocki, az OpenAI vezető tudósa hangsúlyozta a labor elkötelezettségét az olvasható gondolatmenetek iránt. „Az OpenAI az első érvelési modelljeink óta dolgozik a láncolat-gondolat monitorozásának megőrzésén és felhasználásán” – írta Pachocki. „Ez jelenlegi kutatási programunk egyik fő célja.”
Minden AI-modell végez valamennyi opacitásos érvelést, és kevés kutató tekinti a láncolat-gondolat naplókat a modell érvelésének közvetlen reprezentációjának. Ezek a figyelmeztetések azonban nem oszlatják el azt az aggodalmat, hogy az opacitásos rekurrencia megnehezítheti az AI-érvelés monitorozását, különösen ahogy használata növekszik a különböző modellekben. A szerdai utójelentésében a The Information arról számolt be, hogy az Anthropic és a Google DeepMind már megvitatta a technikát.
A hírekre reagáló bejegyzésében Ryan Greenblatt, a Redwood Research vezető tudósa kijelentette, hogy az opacitásos érvelés könnyen gyorsabban skálázódhat, mint a hagyományos láncolat-gondolat érvelés, hatékonyan eltávolítva az összes érvelést a látható csatornákból. „A legnagyobb aggodalmam az, hogy a természetes fejlődés magában foglalná az opacitásos érvelés felfuttatását addig a pontig, ahol a modell teljes egészében vagy szinte teljes egészében latens térben érvel” – írta Greenblatt. „Remélem, még nem késő elkerülni a legaggasztóbb architektúrákat, és hogy az OpenAI itt megáll.”