ÉlőUtoljára: 7 perceMa: 6
Kutatásfrissítve: 01:15

Új módszer deríti fel az LLM-tesztek rejtett képességeit

Az Allen Institute for AI által fejlesztett BenchMIRT módszer lebontja az LLM-teszteket, hogy megértse, mely képességek hajtják a pontszámokat, elkülönítve a biztonságot és az általános érvelést.

Új módszer deríti fel az LLM-tesztek rejtett képességeit
Fotó: Dmytro Vynohradov / Unsplash
forrás: Hugging Face·AI Forradalom szerk.·
Megosztás

Az Allen Institute for AI (AI2) bemutatta a BenchMIRT nevű új módszert, amely az LLM-tesztek mögötti valós teljesítményt vizsgálja. A technika lehetővé teszi a kutatók számára, hogy az egyes kérdések és feladatok szintjén elemezzék, milyen képességeket mérnek valójában a teljesítménytesztek, és hogyan járulnak hozzá a végső pontszámhoz. (Hugging Face)

A kutatás során 100 LLM teljesítményét vizsgálták 16 különböző teljesítményteszten, több mint 34 000 kérdésen keresztül. Az AI2 nem tájékoztatta előzetesen a BenchMIRT-et a teljesítménytesztek céljáról, mégis két domináns dimenziót azonosított: a biztonságot és az általános érvelést. Ezek az eredmények stabilnak bizonyultak ismételt elemzések során.

Dimenziók szétválasztása

A BenchMIRT az Item Response Theory (IRT) elveire épít, de multidimenzionális IRT (MIRT) alkalmazásával képes több, egy kérdésre ható képességet is szétválasztani. A módszer mind az LLM-ekre, mind az egyes kérdésekre vonatkozóan becsléseket végez: előbbi esetében a modell képességeit, utóbbi esetében a kérdés nehézségét és megkülönböztető erejét határozza meg.

Az eredmények rávilágítottak arra, hogy egyes teljesítménytesztek, mint például a BBQ, amely a társadalmi előítéleteket méri, sokkal erősebben korreláltak az általános érveléssel, mint a biztonsággal. Ez arra utal, hogy az alacsony BBQ-pontszám részben a kérdések megértésének vagy az azokon való okfejtésnek nehézségét is tükrözheti, nem csupán a biztonsági viselkedést.

Más teljesítménytesztek, mint a WMDP, amely veszélyes kettős felhasználású tudást tesztel, szintén az általános érveléssel mutatott erősebb kapcsolatot. A HarmBench esetében a szerzői jogi kérdések (pl. dalszövegek generálása) az általános érveléshez, míg a káros tartalmakkal kapcsolatos feladatok a biztonsághoz kötődtek.

Efficiencia és előrejelzési pontosság

A BenchMIRT nemcsak a képességeket, hanem a leginformatívabb kérdéseket is azonosítja. Az elemzés kimutatta, hogy a kérdések mindössze 10%-ának megtartásával is hasonló képet kaphatunk a modellek képességeiről, mint a teljes teljesítményteszt használatával. Az 50%-os kérdéskészlet pedig gyakran még pontosabban mérte a képességeket.

A módszer képes megjósolni egy modell teljesítményét olyan kérdéseken is, amelyeken korábban nem szerepelt. Kísérleteik során 79%-os pontossággal tudták előre jelezni, hogy egy modell helyesen válaszol-e egy ismeretlen kérdésre, ami jelentős javulás a korábbi, 70%-os pontosságú megközelítésekhez képest.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom