ÉlőUtoljára: 1 órájaMa: 4
Eszközökfrissítve: 04:15

Bemutatta az AI-modellek tesztelésére való új eszközét a Prime Radiant

A Simon Willison által fejlesztett smevals keretrendszer lehetővé teszi, hogy felhasználók YAML fájlokban definiált értékelőcsomagokat futtassanak olyan modelleken, mint a GPT-5.5 vagy a Claude-Opus-4.6.

Bemutatta az AI-modellek tesztelésére való új eszközét a Prime Radiant
Fotó: Branko Stancevic / Unsplash
forrás: Simon Willison·AI Forradalom szerk.·
Megosztás

Simon Willison, a Prime Radiant kutatója bemutatta a smevals nevű új eszközt, amely AI-modellek, utasítások és futtatókörnyezetek képességeit hivatott tesztelni. A keretrendszer külön kezeli a futtatásokat és az értékelést, lehetővé téve az eredmények részletes elemzését. (Simon Willison)

A smevals segítségével a felhasználók definiálhatnak egy értékelőcsomagot, amely egy könyvtárnyi YAML fájlból áll. Ezt követően futtathatják az értékelést különböző modellek ellen, például a GPT-5.5 vagy a Claude-Opus-4.6 ellen. A futtatások külön rögzítésre kerülnek, majd az értékelők (graders) egy sor ellenőrzést alkalmaznak az eredményeken. Ezek lehetnek egyszerű string-egyeztetések, XML-validálás, egyéni szkriptek vagy akár más modellek használata is.

Az eredményeket helyi webszerveren lehet felfedezni, vagy exportálhatók statikus HTML-jelentésként. Willison elmondása szerint ez a harmadik iterációja az értékelő keretrendszer ötleteinek, és célja a további projektekhez való kiterjesztése.

Az egyik példa, amit Willison bemutatott, egy haiku-generáló értékelőcsomag volt. Az eszköz felépítése szerint az értékelés (eval) kihívások gyűjteménye, amely egy kérdésre próbál választ adni egy modellel kapcsolatban, például hogy milyen jól generál SVG-ket. Minden értékelés feladatok (tasks) gyűjteménye, ahol egy feladat egy konkrét kihívás, mint például „Generálj egy pelikánt biciklizés közben ábrázoló SVG-t”.

A futtatások (runs) rögzítik, mi történt, amikor egy adott konfigurációt (config) használtak egy adott feladat végrehajtására. A konfiguráció megadhatja az értékelt modellt, de tartalmazhat más paramétereket is, mint például különböző rendszer-promptokat vagy modellparamétereket. Az értékelők (graders) futtatnak egy sor ellenőrzést (checks), amelyek lehetnek egyszerű string-egyeztetések vagy érvényes XML-kimenet ellenőrzése, de akár bonyolultabb, egyéni műveletek is, beleértve más modellek használatát is.

Willison szerint a smevals megalkotása többéves gondolkodás eredménye, és úgy érzi, ez az iteráció „jól sikerült”. További tervek között szerepel az eszköz kiterjesztése és saját projektjein való használata.

Forrás

Feldolgozott sajtóforrás·Simon Willison

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom