ÉlőUtoljára: 1 órájaMa: 7
Eszközökfrissítve: 16:11

Egységes JSON-sémát vezet be a Hugging Face az AI-értékelésekhez

A Hugging Face 229 000 értékelési eredményt egységes JSON-sémába foglalt, 22 000+ modell és 2 200 teljesítményteszt adatait összekapcsolva.

Egységes JSON-sémát vezet be a Hugging Face az AI-értékelésekhez
Fotó: Divaris Shirichena / Unsplash
forrás: Hugging Face·AI Forradalom szerk.·
Megosztás

Az Every Eval Ever (EEE) és a Hugging Face Community Evals mostantól egymással kompatibilis. Az újítás lehetővé teszi az értékelési eredmények keresztbe küldését és értelmezését, miközben összekapcsolja azokat nyílt modellekkel, ranglistákkal és egy egységesített, szabványosított metadatárral.

Az EEE 2026 februárjában indult az EvalEval Koalíció projektjeként, amely az első intézményközi erőfeszítés az AI-értékelési eredmények jelentésének javítására. A Hugging Face ugyanebben a hónapban indította el a Community Evalst, hogy decentralizálja a teljesítményteszt pontszámok jelentését a Hubon. Együttesen ezek az újítások betömködik azokat a réseket, amelyek a felhasználók, kutatók és döntéshozók bizalmát, megértését és a modellek kiválasztását érintik.

Kapcsolódó: AI-generált jegyzetek

Az értékelési eredmények kulcsfontosságúak a modellképességek mérésére, az egymáshoz viszonyított összehasonlításra, valamint a biztonsági és irányítási kérdések megválaszolására. Jelenleg azonban szétszórtan, nehezen összehasonlítható formában léteznek különböző helyeken, papírokban, ranglistákon vagy naplófájlokban. Ugyanazon modell, ugyanazon a teljesítményteszten gyakran eltérő pontszámokat produkálhat, attól függően, hogy ki futtatta és hogyan. Például a LLaMA 65B esetében a MMLU teszten 63,7 és 48,8 pontszámot is jelentettek már.

Kapcsolódó: hallucináció-szűrés

Az EEE egy egységes JSON-sémát használ az értékelési eredmények rögzítésére, amely tartalmazza, hogy ki futtatta az értékelést, melyik modellt használták, hogyan fért hozzá, milyen generációs beállításokat alkalmaztak, és mit jelent pontosan a mért metrika. A GitHub adattárban találhatóak a konverterek, példák és egy közreműködői útmutató.

Kapcsolódó: Hugging Face felhasználói bázis

A Hugging Face-en található adattár immár mintegy 229 000 értékelési eredményt tartalmaz több mint 22 000 modellre és 2 200 benchmarkra vonatkozóan, 31 különböző jelentési formátumból gyűjtve. Ezeknek a futtatásoknak az újragenerálása a nulláról becslések szerint több százezer dollárba kerülne, ami érvként szolgál arra, hogy ne hagyjuk szétszóródni az adatokat, miután valaki már kifizette az előállításukat.

Integráció és hitelesítés

A közreműködők mostantól küldhetnek EEE-eredményeket a Hugging Face Community Evals rendszerébe. Egy konverter automatikusan átalakítja az EEE rekordokat a Hugging Face által elvárt YAML fájlokká, így nem kell ugyanazt az eredményt két formátumban kézzel tárolni. Azok az elsődleges értékelők, akik saját modelljeikről számolnak be, és a harmadik féltől származó értékelők is beküldhetik eredményeiket, amelyek egy hivatalos Hugging Face-fiókon keresztül érkeznek, és így egy hitelesített pipával jelennek meg az EvalEval felületén, jelezve, hogy az adatok közvetlenül a forrásból származnak.

Kapcsolódó: TRL v1.0 post-tréning

Hogyan működik a Hugging Face Community Evals az EEE-vel?

A Hugging Face Community Evals két részből áll. Egy teljesítményteszt egy adatkészlet-tárban él, amely egy `eval.yaml` fájl hozzáadásával regisztrálja magát. Ezt követően az adott adatkészlet oldalán összegyűjtésre és megjelenítésre kerül minden, a Hubon jelentett pontszám. Egy modell pontszámai a `.eval_results/*.yaml` fájlokban élnek a modell adattárában, és megjelennek a modellkártyán, valamint táplálják a hozzájuk tartozó teljesítményteszt ranglistát. Az eredmények egy forrásjelzéssel rendelkeznek, amely közvetlenül a teljes EEE rekordra mutat, ahol a generációs konfiguráció, a harness verzió, az újrabevezetésre vonatkozó jegyzetek és az esetleges példányszintű adatok találhatók.

Kapcsolódó: Hub szerver nélküli AI

A konverter az EEE adattár gyűjteményeit dolgozza fel, letölti azokat és a hivatkozott rekordokat, ellenőrzi az objektum-hash-eket, és megtalálja a támogatott benchmarkokhoz tartozó pontszámokat. Mielőtt bármit közzétenne, auditálja a már létezőket, összehasonlítva az adatbázis-azonosítót és a feladatot. Az eredmények 2026. június 30-án váltak nyilvánossá.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom