ÉlőUtoljára: 1 órájaMa: 18
Kutatás

DeFAb teljesítményteszt teszteli a kreativitást a nagy nyelvi modellekben

A kutatók több mint 372 000 példát és 33,75 millió anyagi szabályt gyűjtöttek össze a DeFAb benchmarkbe, amely 2026. június 19‑én jelent meg MIT licenc alatt.

DeFAb teljesítményteszt teszteli a kreativitást a nagy nyelvi modellekben
Fotó: Nicolás Beltrán López / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

A DeFAb benchmark Patrick Allen Cooper és társai fejlesztették, hogy mérhetővé tegyék a nagy nyelvi modellek defezív következtetési képességét — írta a szerzők. (ArXiv AI)

Megközelítés és adatforrások

A teljesítményteszt négy évtizedes, nyilvánosan finanszírozott tudásbázisok – például az OpenCyc, YAGO és Wikidata – taxonómiai hierarchiáit párosítja a ConceptNet és UMLS viselkedés‑tulajdonság‑gráfjaival, így több mint 372 648 példát hoz létre 33,75 M anyagi szabályból, 18 forrásból.

Kapcsolódó: LLM-javítási folyamat

Modell teljesítmény

Egy szabályalapú logikai megoldó minden példát 50 µs alatt megold, 100 %-os pontossággal (a szerzők szerint). A legjobb frontier language model legfeljebb 65 % pontosságot ér el, a rendering‑robust értékelésnél 23,5 %-ra csökken (a szerzők szerint). A chain‑of‑thought variancia körülbelül 36 pp, a contamináció‑kontroll kísérlet +19,4 pp szint‑3‑beli különbséget mutat (a szerzők szerint).

Kapcsolódó: Token-szintű bizonytalanság

Hard és CONJURE változatok

A DeFAb‑Hard 235 nehéz szint‑3‑példát tartalmaz, ahol a legjobb modell 53,3 % pontosságot ér el, míg a szimbolikus megoldó 100 %-ot. A CONJURE változat 560 Lean 4/Mathlib példát kínál, amelynek arany‑válaszait a bizonyítási kernel ellenőrizte, és pilot tesztben nem talált új koncepciót.

Kapcsolódó: AI érvelési benchmark

Elérhetőség és jövőbeli felhasználás

A teljes teljesítményteszt MIT licenc alatt érhető el a Hugging Face-en, és a verifier pontos jutalmat biztosít DPO, RLVR/GRPO optimalizációhoz. A teljesítményteszt MIT licenc alatt érhető el a Hugging Face-en.

Kapcsolódó: AI ügynökök mérce

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom