Új módszer deríti fel az LLM-tesztek rejtett képességeit
Az Allen Institute for AI által fejlesztett BenchMIRT módszer lebontja az LLM-teszteket, hogy megértse, mely képességek hajtják a pontszámokat, elkülönítve a biztonságot és az általános érvelést.

Az Allen Institute for AI (AI2) bemutatta a BenchMIRT nevű új módszert, amely az LLM-tesztek mögötti valós teljesítményt vizsgálja. A technika lehetővé teszi a kutatók számára, hogy az egyes kérdések és feladatok szintjén elemezzék, milyen képességeket mérnek valójában a teljesítménytesztek, és hogyan járulnak hozzá a végső pontszámhoz. (Hugging Face)
A kutatás során 100 LLM teljesítményét vizsgálták 16 különböző teljesítményteszten, több mint 34 000 kérdésen keresztül. Az AI2 nem tájékoztatta előzetesen a BenchMIRT-et a teljesítménytesztek céljáról, mégis két domináns dimenziót azonosított: a biztonságot és az általános érvelést. Ezek az eredmények stabilnak bizonyultak ismételt elemzések során.
Dimenziók szétválasztása
A BenchMIRT az Item Response Theory (IRT) elveire épít, de multidimenzionális IRT (MIRT) alkalmazásával képes több, egy kérdésre ható képességet is szétválasztani. A módszer mind az LLM-ekre, mind az egyes kérdésekre vonatkozóan becsléseket végez: előbbi esetében a modell képességeit, utóbbi esetében a kérdés nehézségét és megkülönböztető erejét határozza meg.
Az eredmények rávilágítottak arra, hogy egyes teljesítménytesztek, mint például a BBQ, amely a társadalmi előítéleteket méri, sokkal erősebben korreláltak az általános érveléssel, mint a biztonsággal. Ez arra utal, hogy az alacsony BBQ-pontszám részben a kérdések megértésének vagy az azokon való okfejtésnek nehézségét is tükrözheti, nem csupán a biztonsági viselkedést.
Más teljesítménytesztek, mint a WMDP, amely veszélyes kettős felhasználású tudást tesztel, szintén az általános érveléssel mutatott erősebb kapcsolatot. A HarmBench esetében a szerzői jogi kérdések (pl. dalszövegek generálása) az általános érveléshez, míg a káros tartalmakkal kapcsolatos feladatok a biztonsághoz kötődtek.
Efficiencia és előrejelzési pontosság
A BenchMIRT nemcsak a képességeket, hanem a leginformatívabb kérdéseket is azonosítja. Az elemzés kimutatta, hogy a kérdések mindössze 10%-ának megtartásával is hasonló képet kaphatunk a modellek képességeiről, mint a teljes teljesítményteszt használatával. Az 50%-os kérdéskészlet pedig gyakran még pontosabban mérte a képességeket.
A módszer képes megjósolni egy modell teljesítményét olyan kérdéseken is, amelyeken korábban nem szerepelt. Kísérleteik során 79%-os pontossággal tudták előre jelezni, hogy egy modell helyesen válaszol-e egy ismeretlen kérdésre, ami jelentős javulás a korábbi, 70%-os pontosságú megközelítésekhez képest.