Rejtve hagyja gondolatmenetét az OpenAI Astra modellje, aggodalmat vált ki ez a kutatók körében
Ryan Greenblatt kutató szerint az Astra képes nehéz feladatokat teljesen a fejében megoldani, ami rendkívül aggasztó. Jakub Pachocki, az OpenAI vezető tudósa szerdán reagált, és további részleteket ígért a témában.

Az OpenAI Astra modellje láthatatlanul gondolkodik, ami aggályokat vet fel a monitorálhatóság és az AI biztonság terén. A kutatók és a cég vezetője is figyelmeztet. (TNW)
Az Astra modellje láthatóan kevesebb gondolatmenetet jelenít meg szövegként, ami aggodalomra ad okot a kutatók körében. Ryan Greenblatt AI-biztonsági kutató szerint „úgy tűnik, hogy képes nehéz versenyfeladatokat teljesen a fejében megoldani”, ami „rendkívül aggasztónak” tűnik. Felmerültek jelentések arról, hogy az OpenAI szándékosan korlátozhatta a modell kimeneteinek láthatóságát a képességeinek javítása érdekében, bár ezt a cég nem erősítette meg — írja a Semafor.
Jakub Pachocki, az OpenAI vezető tudósa szerdán reagált a hírekre, hangsúlyozva, hogy „meg akarja akadályozni a félrevezető jelentések által elindított versenyt a monitorálhatatlan irányába”. Pachocki tervei szerint további részleteket fog megosztani a témában.
A monitorálhatóság új és törékeny lehetősége
Az OpenAI és más nagy technológiai cégek kutatói már 2025 júliusában publikáltak egy tanulmányt, amely a „chain-of-thought” monitorálhatóságot új és törékeny lehetőségként azonosította az AI-biztonság szempontjából. A mintegy 40 kutató — köztük az OpenAI, a Google DeepMind, az Anthropic, a Meta, az Amazon, az Egyesült Királyság AI Biztonsági Intézetének és a Redwood Research képviselői — által jegyzett tanulmányban Pachocki is szerepel, Greenblatt pedig a Redwoodnál dolgozik.
A dokumentum arra kérte a fejlesztőket, hogy építsenek ki szabványosított értékeléseket a monitorálhatóságra, jelentsék az eredményeket, módszertanokat és korlátokat a rendszerkártyákon, valamint vegyék figyelembe a monitorálhatóságot a képesség mellett a modell betanításáról vagy telepítéséről való döntéskor.
EU-s jelentéstételi kötelezettségek
Európában a jelentéstételnek konkrét címzettje és határideje van. Az EU GPAI Code of Practice aláíróinak piaci bevezetésig Modellszintű Jelentést (Model Report) kell benyújtaniuk az AI Office-nak, amely tartalmazza az értékeléseket, a mitigációs intézkedéseket és a külső értékelők jelentéseit.
Minden jelentésnek tartalmaznia kell öt véletlenszerűen kiválasztott bemeneti és kimeneti mintát minden releváns modellértékelésből, hogy a vállalaton kívül bárki függetlenül értékelhesse a munkát. Az OpenAI, mint teljes aláíró, már most 20%-os számítási költséget szabott ki saját rendszereinek figyelésére.