Saját adatokkal tesztelhetők az AI-modellek az Optima platformon
Az Artificial Analysis által bemutatott Optima platformon a felhasználók Hugging Face-ről, Arize-ről, Braintrust-ról vagy Langfuse-ról származó adatkészletekkel hozhatnak létre teszteket. A rendszer objektív kritériumok vagy páros összehasonlítás alapján értékeli a modelleket.

Az Artificial Analysis bemutatta az Optima platformot, amely lehetővé teszi a felhasználók számára, hogy saját, specifikus használati esetekre szabott AI-teszteket hozzanak létre. A platform célja, hogy áthidalja a szakadékot a nagymértékben előre definiált, általános célú teljesítménytesztek és a valós alkalmazások eltérő igényei között. (The Decoder)
A rendszer támogatja a Hugging Face, Arize, Braintrust és Langfuse platformokról származó adatkészletek, valamint AI-ügynökök nyomkövetési adatainak használatát. Ha a felhasználó nem rendelkezik ilyen adatokkal, leírhatja a kívánt használati esetet, és mintákat adhat meg bemenetekre és kimenetekre, amelyeket az Optima kiegészít és tesztelhetővé alakít.
Értékelési módszerek és költségelemzés
Az Optima kétféle értékelési módszert kínál: objektív kritériumok alapján történő értékelést, vagy páros összehasonlítást. Ez utóbbi esetben a felhasználók először válaszpárokat értékelnek, majd a platform ebből vezeti le a teljes rangsort. A nyers modellminőség mellett a rendszer a feladatonkénti költséget és az időt is nyomon követi, így ellenőrizhetővé válik, hogy egy teljesítménybeli javulás indokolja-e a magasabb költséget vagy hosszabb feldolgozási időt.
Korai tesztelők tízszeres költségcsökkentést értek el pénzügyi és könyvelési ügynökök esetében, jelentős minőségromlás nélkül — közölte a mesterséges intelligencia-fejlesztő. A platform a felhasznált modellek tényleges tokenköltségét számolja fel, mindenféle felár nélkül. Az értékelések díja kritériumonként 0,125 dollár, a páros összehasonlítások pedig 0,375 dollárba kerülnek.
Átláthatóság és tesztelési eredmények
A rendszer minden teszt futtatása és értékelési kör elején egy becsült költség alapján egyenleget tart. Az Optima a teljesítménytesztek általános problémájára kínál megoldást: a különböző utasítások és beállítások jelentősen befolyásolhatják az eredményeket. A platform lehetővé teszi, hogy a tesztek pontosan tükrözzék a célzott képességeket és a valós alkalmazási forgatókönyveket.
A tesztek hasznossága attól függ, milyen precízen vannak definiálva a célképességek, mennyire reprezentatívak a tesztesetek, és hogyan implementálják az értékelést. Az Optima első tesztjei március végén zárultak.