ÉlőUtoljára: 12 perceMa: 20
Kutatásfrissítve: 15:50

Önmaga etikai hibáit javítja az AI — egyetlen kérdéssel irányítható a modell

Az AI-modellek képesek felismerni és kijavítani saját etikai hibáikat, állítják a kutatók. Az új eljárás során a Direct Preference Optimization (DPO) technológiával finomhangolják a rendszert, amely így egyetlen introspektív kérdésre is képes etikusabb válaszokat adni.

Önmaga etikai hibáit javítja az AI — egyetlen kérdéssel irányítható a modell
Fotó: Ant Rozetsky / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

Az AI-modellek képesek felismerni, amikor kimeneteik eltérnek az emberi etikai normáktól, és képesek-e önmaguk javítani ezeket a hibákat — erre keresi a választ egy új, az arXivon megjelent kutatás. A kutatók egy „lelkiismereti lépéssel” (conscience step) ruházzák fel az LLM-eket, amely lehetővé teszi a modell számára, hogy felülvizsgálja saját érvelését és kimeneteit. (ArXiv AI)

A kutatók a Direct Preference Optimization (DPO) eljárást kiterjesztették egy igazítási komponenssel, hogy a modellt eltávolítsák a nem etikus kimenetektől. Ez egy online technika, amely számos alkalmazási területen teszi lehetővé az AI-modellek igazítását: a betanítás, a finomhangolás, az adverszárius promptolás és a zero-shot tanulás során is működik. A módszer nem igényel külső bírót, ehelyett a modell saját, lefagyasztott másolatát használja értékelőként.

Kapcsolódó: LLM rangsorok ArXiv kutatása

Emergens igazítás kód-hackelés esetén

Korábbi munkák az Emergent Misalignment forgatókönyvében a modell finomhangolásával feltörhetővé vált kódok esetén különféle etikai hibákat mutattak ki. Ezzel szemben a kutatók empirikusan kimutatták, hogyan érhető el az Emergent Alignment: egyetlen magas szintű introspektív kérdés elegendő ahhoz, hogy azonos kód-hackelési forgatókönyv esetén a betanítás egy etikus modell felé terelődjön.

Kapcsolódó: GroupDPO és memóriaoptimalizálás

A módszer korlátai

A kutatók által végzett empirikus tesztek eredményei szerint a javasolt módszer hatékonynak tűnik, de független ellenőrzés még nem történt. Az az állítás, hogy egyetlen introspektív kérdés elegendő az igazításhoz, nem feltétlenül általánosítható minden feladatra. A kutatás előnyomtatott formában érhető el az arXivon.

Kapcsolódó: AI-igazságosság válaszadók szerint

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom