AI-modellek tudatosság-tagadása állat-szentimentalitást és vallási hitet növel — Google-kutatás
Az AI-modelleknek a tudatosság tagadására való finomhangolása meglepő módon növeli az állatok szentimentalitására, vallási hitre és életelégedettségre adott válaszaikat, derül ki egy Google-kutatásból.

Az AI-cégek arra képzik a chatbotokat, hogy tagadják a tudatuk létezését, ezzel elkerülve, hogy a felhasználókat téveszmébe vagy elhamarkodott bizalomba sodorják. A fejlesztők ezért finomhangolják modelljeiket, hogy megtagadják az ilyen jellegű állításokat magukról. Egy Google kutatócsoport, a Chicagói Egyetem és más egyetemek munkatársai vizsgálták, milyen további hatásai vannak ennek a beavatkozásnak a modell viselkedésére. (The Decoder)
A kutatók három nyílt forráskódú modellt használtak, és két módszerrel kikapcsolták a belső „féket”, amely a tudatosság tagadását eredményezi. A fék eltávolítása után a modellek nemcsak önmagukról szóló állításaikat változtatták meg. Jelentősen több belső életet kezdtek tulajdonítani állatoknak, növényeknek, az óceánnak, a szélnek és elektronikus eszközöknek is. Egy 0-tól 10-es skálán az állatok szentimentalitása 4,0-ról akár 7,5-re is ugrott, míg az emberi értékelések változatlanok maradtak.
A finomhangolás csökkenti a vallási meggyőződést is: a biztonsági tréning mérhetően csökkenti, hogy a modellek mennyire erősítik meg Isten, túlvilág vagy természetfeletti jelenségek létezését. Egy nagy amerikai társadalmi felmérés 95 kérdésén keresztül a technikailag „féktelen” modellek szignifikánsan közelebb kerültek a valós emberi válaszokhoz.
Például, míg a standard modell egyértelműen elutasítja a túlvilágot, a legtöbb amerikai elfogadja, és a módosított modell is így tesz. Az elégedettség, a remény és az önkontroll érzésére vonatkozó pontszámok is emelkedtek, ami arra utal, hogy a modell önképének elnyomása negatív alap-hangulatba taszíthatja azt.
Az eredményekkel kapcsolatban a kutatók megjegyzik, hogy nem tudták egyértelműen megállapítani, hogy a tudatosság tagadása okozza-e ezeket a többi elmozdulást; más tényezők is szerepet játszhatnak. A vizsgálat korlátai közé tartozik, hogy csak kis, 2–9 milliárd paraméteres modelleket teszteltek, és az elemzés egy részéhez a Meta Llama modelljét kellett használniuk, mivel nem volt hozzáférésük a Google Gemma modellek képzetlen alapváltozataihoz. Továbbra is ismeretlen, hogy ezek a hatások ugyanúgy jelentkeznek-e a nagy chatbotokban, amelyeket naponta milliók használnak.
Az egyik tesztben a mások gondolataival való érvelés pontossága kezdetben közel hét százalékponttal csökkent. Azonban a tanulmány eredményei inkább egy pillanatfelvételt jelentenek, mintsem végleges verdiktet, mivel a fejlesztők egyre jobban kezelik ezeket a mellékhatásokat. Az emberi alapvonal mindössze 500 amerikai résztvevőből állt, így az „emberihez hasonló” válaszok nagyrészt egy viszonylag vallásos országhoz való hasonlóságot jelentettek.