DeFAb teljesítményteszt teszteli a kreativitást a nagy nyelvi modellekben
A kutatók több mint 372 000 példát és 33,75 millió anyagi szabályt gyűjtöttek össze a DeFAb benchmarkbe, amely 2026. június 19‑én jelent meg MIT licenc alatt.

A DeFAb benchmark Patrick Allen Cooper és társai fejlesztették, hogy mérhetővé tegyék a nagy nyelvi modellek defezív következtetési képességét — írta a szerzők. (ArXiv AI)
Megközelítés és adatforrások
A teljesítményteszt négy évtizedes, nyilvánosan finanszírozott tudásbázisok – például az OpenCyc, YAGO és Wikidata – taxonómiai hierarchiáit párosítja a ConceptNet és UMLS viselkedés‑tulajdonság‑gráfjaival, így több mint 372 648 példát hoz létre 33,75 M anyagi szabályból, 18 forrásból.
Kapcsolódó: LLM-javítási folyamat
Modell teljesítmény
Egy szabályalapú logikai megoldó minden példát 50 µs alatt megold, 100 %-os pontossággal (a szerzők szerint). A legjobb frontier language model legfeljebb 65 % pontosságot ér el, a rendering‑robust értékelésnél 23,5 %-ra csökken (a szerzők szerint). A chain‑of‑thought variancia körülbelül 36 pp, a contamináció‑kontroll kísérlet +19,4 pp szint‑3‑beli különbséget mutat (a szerzők szerint).
Kapcsolódó: Token-szintű bizonytalanság
Hard és CONJURE változatok
A DeFAb‑Hard 235 nehéz szint‑3‑példát tartalmaz, ahol a legjobb modell 53,3 % pontosságot ér el, míg a szimbolikus megoldó 100 %-ot. A CONJURE változat 560 Lean 4/Mathlib példát kínál, amelynek arany‑válaszait a bizonyítási kernel ellenőrizte, és pilot tesztben nem talált új koncepciót.
Kapcsolódó: AI érvelési benchmark
Elérhetőség és jövőbeli felhasználás
A teljes teljesítményteszt MIT licenc alatt érhető el a Hugging Face-en, és a verifier pontos jutalmat biztosít DPO, RLVR/GRPO optimalizációhoz. A teljesítményteszt MIT licenc alatt érhető el a Hugging Face-en.
Kapcsolódó: AI ügynökök mérce