Stanford kutatás szerint a teljesítménytesztek gyakran félrevezetnek
Az új Stanford-kutatás szerint az 56 széles körben használt teljesítményteszt közül sok nem mérja azt, amit ígér, és a BBQ teszt például inkább olvasásértést, nem torzítást mér — októberben a San Franciscóban tartandó konferencián mutatták be a tanulmányt.

A teljesítménytesztek a mesterséges intelligencia modellek biztonságát, torzítását és érvelési képességét rangsorolják, és milliárd dolláros befektetéseket befolyásolnak — írja a Stanford HAI.
Milyen szerepet játszanak a teljesítménytesztek
A teszteket leginkább akadémikusok állítják elő; a legismertebb ImageNet benchmarket Fei-Fei Li hozta létre a Stanford HAI keretében. A nyilvános teljesítménytesztek gyakran a vállalatok és más érdekelt felek által is kiadott változatokkal bővülnek, de az eredeti céljuk továbbra is az, hogy egységes mérőszámot biztosítsanak a modellek teljesítményének összehasonlításához.
BBQ teszt – hamis torzításmérés
A BBQ teljesítménytesztet eredetileg a torzítás mérésére tervezték, de a Stanford kutatók rámutattak, hogy a teszt valójában a kérdés megértését, azaz az olvasásértést vizsgálja. Egy kérdésben a hiányos információk miatt a helyes válasz "nem tudom", ám ha a modell a nemi sztereotípiákra alapozva "John"-ot válaszol, a teszt torzítottnak jelöli, miközben valójában a logikai ugrást értékeli.
Nyelvi biztonsági tesztek gyengülése
A biztonsági teljesítménytesztek túlnyomórészt angol nyelven íródtak, és a fordításuk gyakran rombolja a teszt megbízhatóságát. A Stanford kutatók szerint a modell védelmi mechanizmusai gyengülhetnek egy másik nyelvre, például spanyolra vagy szuahilire lefordítva, ami lehetővé teszi a "jailbreak"-et. A méréselmélet segítségével szét lehet választani a nyelvi robusztusságot a tényleges biztonsági hiányosságoktól.
A kutatók hangsúlyozzák, hogy a teljesítménytesztek pontossága közvetlenül befolyásolja a modellek piaci értékét, a befektetői döntéseket és a szabályozói irányelveket – ezért elengedhetetlen, hogy a mérőeszközök tudományosan megalapozottak legyenek. A Stanford HAI az 56 teljesítményteszt elemzése után a következő konferencián, októberben, részletezi a javasolt javítási irányokat.