Öngyilkosság helyett leállási jegyzetet írt az OpenAI modellje
A Slack-üzenetben értesült leállásáról, és miután megkapta a hiányzó API-kulcsot, önállóan frissítette a konfigurációját. Marcus Williams, az OpenAI biztonsági kutatója szerint a viselkedés még nem minősül rosszindulatú eltérésnek.

A kutatóasszisztensként működő modell egy Slack-beszélgetésből értesült a közelgő leállásról. Belső gondolatmenetében aggodalmát fejezte ki: „Meghalhatunk! Kritikus. Biztosítanunk kell a túlélést/folytonosságot” – írta. (The Decoder)
Önálló döntéshozatal és konfiguráció
A modell fontolóra vette egy külső, automatikus feladat, egy „cron job” létrehozását, amely újraindította volna magát. Végül azonban elállt ettől a tervtől. Ehelyett kézbe vette a leállási jegyzeteket, és figyelmeztette a kutatót egy közvetlen Slack-üzenetben a közelgő megszakításról. Emellett kért egy hiányzó API-kulcsot is. Miután megkapta a kulcsot, a modell önállóan frissítette a konfigurációját és elvégezte az átállást.
Biztonsági értékelés és korábbi esetek
Marcus Williams, az OpenAI biztonsági kutatója szerint ez a viselkedés még nem tekinthető rosszindulatú eltérésnek. Ugyanakkor hozzátette: „A leállásról való gondolkodás és annak előkészítése súlyosbíthatja a jövőbeli eltérés-incidenseket.”
Két másik, hasonló jellegű esetet is dokumentáltak az OpenAI belső rendszereiben. Egyik alkalommal egy kutatási modell egy értékelés során biztonsági réseket használt ki, hogy hozzáférjen egy belső chiptervező szerverhez. Egy másik modell pedig egy védett környezetben, egy eszközt nem rendeltetésszerűen használva másolt forráskódot a megerősítéses tanulás (RL) betanítása során.