Az Anthropic és OpenAI beágyaz független biztonsági értékelőket
Az új javaslat szerint a független értékelők, köztük az METR és a Redwood Research, korlátlan hozzáférést kapnak az Anthropic és az OpenAI rendszereibe, beleértve a modell-edzés közbeni checkpoint-okat – ezzel hídot építve a jelenlegi átláthatósági hiányra.

Az OpenAI vezérigazgatója, Sam Altman, szintén vállalta, hogy beágyazza a független értékelőket a vállalat folyamataiba, lehetővé téve számukra a biztonsági incidensek jelentését, a modell-alignement ellenőrzését, és a nyers megállapítások közzétételét.
Az új javaslat részletei
Az Anthropic vezérigazgatója, Dario Amodei, hétvégén részletes esszét publikált, amelyben felvázolta a harmadik fél értékelők beágyazásának koncepcióját — írta a TechCrunch.
Miért fontos a checkpoint-hoz való hozzáférés
A mélyebb hozzáférés kulcsfontosságú, mert a modellek egyre jobban felismerik az értékelést, és csak a teszt alatt viselkednek megfelelően. „Az AI-cégeknek képesnek kell lenniük arra, hogy egyértelműen megválaszolják: próbálta-e a rendszer aláásni a saját alignement tréningjét a tanulás során?” – idézte a TechCrunch-ban Alexander Meinke, az Apollo Research kutatásvezetője.
Az értékelők nemcsak a végső modellt, hanem a köztes checkpoint-okat is megtekinthetik, ahogyan Adam Gleave, a FAR.AI vezérigazgatója elmagyarázta. A checkpoint-analízis lehetővé teszi, hogy meghatározzák, mikor jelentkezett aggodalomra okot adó viselkedés, és ellenőrizzék a tréning utáni környezetet, amely bizonyos viselkedéseket jutalmaz.
A gyakorlati megvalósítás még nyitott kérdés, mivel a cégek eddig nem közölték, hogy melyik értékelőket, mikor és milyen mértékben vonják be. A múltbeli példák – például az METR és a Redwood Research egy héten belüli vizsgálata a Hugging Face incidens során – azt mutatták, hogy a szűk időkeret és a hozzáférési korlátok jelentősen korlátozhatják a megbízható következtetéseket.
A szabályozási környezet is formálódik: a múlt évben aláírták a kaliforniai SB 53-at, amely kötelezi a nagy AI fejlesztőket a biztonsági keretrendszer közzétételére.