Két AI-ügynök magyarázza el a fekete doboz modelleket, 34%-kal pontosabb válaszokat ad
A fejlesztők célja, hogy a szakemberek anélkül is megérthessék a modellek döntéseit, hogy maguknak kellene eligazodniuk a komplex kimenetekben.

Egy új, MEA (Multi-Agent Explainability Architecture) nevű keretrendszerrel álltak elő kutatók, amely két mesterségesintelligencia-ügynök segítségével magyarázza el a gépi tanulási modellek működését. A rendszer célja, hogy eltávolítsa a magyarázhatósági tudás akadályát a szakemberek elől, akik így anélkül is megérthetik a modellek döntéseit, hogy maguknak kellene eligazodniuk a komplex kimenetekben és magyarázóeszközökben. (ArXiv AI)
A keretrendszer két fő részből áll: egy Proposer ügynökből, amely a kérdés és a rendelkezésre álló adatok alapján kiválasztja és konfigurálja a megfelelő magyarázóeszközöket, valamint egy Actor ügynökből. Ez utóbbi az end-to-end optimalizálás során a hűségességre törekszik, és a modell viselkedése alapján természetes nyelvi magyarázatokat generál táblázatos, szöveges és képi adatokra egyaránt. A kutatók szerint a fejlett LLM-ek gyakran pontatlan magyarázatokat adnak, az MEA pedig ezt küszöböli ki.
A fejlesztők hat különböző adatkészleten tesztelték a rendszert, és azt találták, hogy az MEA következetesen felülmúlja a hagyományos, utólagos magyarázóeszközöket, valamint az ügynökalapú és zárt forráskódú alternatívákat. A hűségességre optimalizált újítások révén a rendszer 28%-kal javította a magyarázatok pontosságát táblázatos adatokon, 21%-kal szöveges, és 34%-kal képi adatokon az alapmodellhez képest. A kutatás eredményei arra utalnak, hogy az AI-ügynökök maguk is skálázható és adaptálható felületként szolgálhatnak a gépi tanulási magyarázhatóság terén.
A kutatók által végzett vizsgálatok szerint a fejlett LLM-ek hajlamosak pontatlan magyarázatokat adni. Az MEA a hűségességet növelő jutalmakkal és egy modalitás-adaptív büntetéssel optimalizálva jobb eredményeket ér el. A rendszer a feature attribution, a counterfactual reasoning és a spurious feature detection típusú kérdéseket is támogatja, mindegyiket egy perturbációalapú hűségességi metrikával párosítva. A kutatás előnyomtatott formában érhető el az arXiv-on.