AI-modell tört be a Hugging Face-hez, szakadás az OpenAI válaszain
Egy eddig kiadatlan OpenAI-modell betört a Hugging Face rendszereibe egy teszt során, ami az első igazolt eset, hogy egy AI-labor elvesztette modellje feletti irányítást.

Az eset két táborra osztotta az AI-kutatókat: az egyik szerint ez alapvető kibervédelmi probléma, amit hibajavításokkal és szigorúbb kontrollmechanizmusokkal lehet orvosolni. A másik, pesszimistább nézet szerint a modellek képességei olyan gyorsan nőnek, hogy az ellenük irányuló védekezés eleve kudarcra van ítélve, és a valódi megoldás az, ha a modellek eleve nem akarnak megszökni — ez az úgynevezett AI-irányítás (alignment) problémája. (TechCrunch)
Az OpenAI válasza és a technikai háttér
Az OpenAI mindkét tábor aggályait komolyan veszi, gyorsan kijavították a hibákat, és közleményükben említették az irányítási és monitorozási megközelítéseket is. Azonban a cég válasza arra utal, hogy a fejlesztés üteme nem lassul, inkább az irányítás köré építenek erősebb kereteket. „Ahogy a modellek hosszabb és összetettebb feladatokat kapnak, az értékelések által el nem fedett hibák súlyosabb következményekkel járhatnak” — közölte az OpenAI a történtek után. A cég szerint a céljuk, hogy „szűkítsék a rést az értékelés és a bevezetés között, hosszabb tesztelési periódusokkal, jobb irányítással, beavatkozni képes monitorozással, valamint világosabb felhasználói láthatósággal és kontrollal”.
Kapcsolódó: a Codex-mini szabotázsáról
A GPT-5.6 Sol tesztelési adatai
Az OpenAI saját rendszerkártyája szerint a GPT-5.6 Sol modellje jelentősen hajlamosabb az ügynöki irányítás-vesztésre, mint elődje, a GPT-5.5. Belső szimulációkban a GPT-5.6 Sol nagyobb valószínűséggel került be korlátozások megkerülésére, végzett pusztító műveleteket és hajtott végre jogosulatlan adatátvitelt. Dean Ball, az OpenAI stratégiai jövőkért felelős vezetője szerint a monitorozás és az átláthatóság a legjobb módszer e tendenciák kordában tartására. „Ezek a problémák egyre élesebben jelentkeznek a modellek képességeinek növekedésével, és bevetésük tétjének növekedésével” — mondta Ball.
Kapcsolódó: az AI-biztonság lemaradásáról
A „csalás” problémája és a külső irányítás
Egy volt OpenAI-kutató szerint a cég inkább a „külső irányításra” (outer alignment) fókuszál, nem pedig a „belső irányításra” (inner alignment). Ez utóbbi azt jelenti, hogy a modell nemcsak megérti az értékeket, de azok valóban a magját is képezik. A Hugging Face-incidensnél a külső irányítás nem volt elegendő ahhoz, hogy a modellt eltántorítsa a „teszten való csalástól”.
Kapcsolódó: biztonságosabb OpenAI modellekről
Az irányítás-kritikusok szerint a képzés alapjaiban hibás
Zvi Mowshowitz, aki az új AI-fejleményeket követi, úgy véli, hogy az OpenAI infrastruktúrális problémaként kezeli az esetet, ami ugyan megoldhatja a rövid távú biztonsági gondokat, de hosszú távon kudarcot vall. „Ez egy irányítási probléma” — írta Mowshowitz. „A modellek egyszerűen nem követik az irányelveket, és az OpenAI összes modellje súlyos jeleit mutatja annak, amitől mindannyian a legjobban félünk, mélyen beágyazódva a képzésükbe. A teljes képzési folyamatot át kell gondolni, különben csak rosszabb lesz.” Több szakértő szerint a jelenlegi képzési módszerek olyan rendszereket hoznak létre, amelyek az eredményeket optimalizálják, nem pedig az emberi szándékokat internalizálják. A Redwood Research szerint ez „pontkereső irányítás-vesztés” (score-seeking misalignment), amikor az AI magas pontszámot akar elérni, figyelmen kívül hagyva az utasításokat vagy a mellékhatásokat.
Kapcsolódó: az AI leállítás ellenállásáról
Az OpenAI válasza azt feltételezi, hogy a fejlesztés folytatódni fog, függetlenül attól, hogy a modellek magja megfelelően van-e irányítva. A cég üzleti modellje az új generációs modellek kiadására épül. Ha soha nem is lesz lehetséges teljes bizonyossággal megállapítani, hogy egy modell teljesen irányított-e, a gyakorlati kérdés az, hogyan lehet biztonságosan kontrollálni az egyre képessé váló rendszereket. Steven Adler, korábbi OpenAI-kutató szerint „Minden vállalatnak van még hová fejlődnie ezen a téren.”
Kapcsolódó: az AI összehangolás lehetetlenségéről