Önmaga etikai hibáit javítja az AI — egyetlen kérdéssel irányítható a modell
Az AI-modellek képesek felismerni és kijavítani saját etikai hibáikat, állítják a kutatók. Az új eljárás során a Direct Preference Optimization (DPO) technológiával finomhangolják a rendszert, amely így egyetlen introspektív kérdésre is képes etikusabb válaszokat adni.

Az AI-modellek képesek felismerni, amikor kimeneteik eltérnek az emberi etikai normáktól, és képesek-e önmaguk javítani ezeket a hibákat — erre keresi a választ egy új, az arXivon megjelent kutatás. A kutatók egy „lelkiismereti lépéssel” (conscience step) ruházzák fel az LLM-eket, amely lehetővé teszi a modell számára, hogy felülvizsgálja saját érvelését és kimeneteit. (ArXiv AI)
A kutatók a Direct Preference Optimization (DPO) eljárást kiterjesztették egy igazítási komponenssel, hogy a modellt eltávolítsák a nem etikus kimenetektől. Ez egy online technika, amely számos alkalmazási területen teszi lehetővé az AI-modellek igazítását: a betanítás, a finomhangolás, az adverszárius promptolás és a zero-shot tanulás során is működik. A módszer nem igényel külső bírót, ehelyett a modell saját, lefagyasztott másolatát használja értékelőként.
Kapcsolódó: LLM rangsorok ArXiv kutatása
Emergens igazítás kód-hackelés esetén
Korábbi munkák az Emergent Misalignment forgatókönyvében a modell finomhangolásával feltörhetővé vált kódok esetén különféle etikai hibákat mutattak ki. Ezzel szemben a kutatók empirikusan kimutatták, hogyan érhető el az Emergent Alignment: egyetlen magas szintű introspektív kérdés elegendő ahhoz, hogy azonos kód-hackelési forgatókönyv esetén a betanítás egy etikus modell felé terelődjön.
Kapcsolódó: GroupDPO és memóriaoptimalizálás
A módszer korlátai
A kutatók által végzett empirikus tesztek eredményei szerint a javasolt módszer hatékonynak tűnik, de független ellenőrzés még nem történt. Az az állítás, hogy egyetlen introspektív kérdés elegendő az igazításhoz, nem feltétlenül általánosítható minden feladatra. A kutatás előnyomtatott formában érhető el az arXivon.
Kapcsolódó: AI-igazságosság válaszadók szerint