ÉlőUtoljára: 47 perceMa: 22
Biztonságfrissítve: 13:10

Kevés „jó” adattal is biztonságosabbak az OpenAI modelljei

Egy kis mennyiségű, pozitív tulajdonságokra fókuszáló adat elegendő volt ahhoz, hogy az OpenAI modelljei 44 különböző biztonsági teszten jobban teljesítsenek, miközben továbbra is könnyen irányíthatók maradnak.

Kevés „jó” adattal is biztonságosabbak az OpenAI modelljei
Fotó: AI Forradalom
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

Az OpenAI kutatói új módszert fejlesztettek ki a mesterséges intelligencia (AI) modellek biztonságának növelésére. A „beneficial trait” elnevezésű tréning során a modelleket olyan valósághű beszélgetésekkel tanítják, amelyek bizonyos kívánatos tulajdonságokat – mint az igazmondás, a szerénység, a korrigálhatóság, a következetes érvelés, a méltányosság és az emberi jólét iránti aggodalom – tesztelik. A kutatás eredményeit az OpenAI saját blogján ismertette.

A tréning során csak kis mennyiségű, a kívánatos tulajdonságokat tartalmazó adatot kevertek a szokásos megerősítéses tanulási (RL) folyamatba. Ennek ellenére a modell 53 független tesztből 44-en javult – közölte a The Decoder. Ezek a tesztek olyan területeket vizsgáltak, mint a megtévesztés, az őszinteség, a hízelgés, a jutalom-manipuláció, valamint az egészségügyi és mentális egészségügyi forgatókönyvek. Érdekesség, hogy már csak egészségügyi adatokkal végzett tréning is javította az olyan nem egészségügyi értékeléseket, mint a jutalom-manipuláció és a megtévesztés felismerése.

Kapcsolódó: Claude biztonsági frissítése

Ellenállás a káros befolyásnak

A kutatók azt is tesztelték, hogyan teljesítenek a modellek nyomás alatt. Azok az adverszárius utasítások, amelyek a kiindulási modellt jelentősen destabilizálták, sokkal kisebb hatást gyakoroltak a „beneficial trait” tréningen átesett modellre. A káros finomhangolás kevésbé tudta aláásni a betanított tulajdonságokat. A modell továbbra is ugyanolyan mértékben volt irányítható hasznos utasításokkal, mint korábban. Ezt a jelenséget „szelektív kitartásnak” nevezték el: a modell ellenáll a káros irányításnak anélkül, hogy elveszítené rugalmasságát.

Kapcsolódó: OpenAI-Microsoft kiberpartnertársaság

Más út, mint az Anthropic

Az OpenAI megközelítése élesen eltér az Anthropic hasonló célokat kitűző módszerétől. Míg az OpenAI empirikusan mérhető viselkedési tulajdonságokra támaszkodik, amelyeket RL-lel erősítenek valós forgatókönyvekben, addig az Anthropic egy explicit „Claude alkotmányra” épít, amely egy írott értékrendet tartalmaz. Az OpenAI erősen támaszkodik a benchmarkokra: 44-ből 53 értékelés mutatott javulást, amely domaineken és értékelési módszereken átívelően általánosult. Az Anthropic inkább elv-alapú megközelítést alkalmaz, ahol a modellnek meg kell értenie, miért kívánatos bizonyos viselkedésformák, alkotmányos szövegekre és magas minőségű példákra alapozva. A két módszer közvetlen összehasonlítása egyelőre nem létezik.

Kapcsolódó: NVIDIA AI-ügynökök ellenőrzése

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom