ÉlőUtoljára: 25 perceMa: 2
Eszközökfrissítve: 00:16

Saját adatokkal tesztelhetők az AI-modellek az Optima platformon

Az Artificial Analysis által bemutatott Optima platformon a felhasználók Hugging Face-ről, Arize-ről, Braintrust-ról vagy Langfuse-ról származó adatkészletekkel hozhatnak létre teszteket. A rendszer objektív kritériumok vagy páros összehasonlítás alapján értékeli a modelleket.

Saját adatokkal tesztelhetők az AI-modellek az Optima platformon
Fotó: Growtika / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

Az Artificial Analysis bemutatta az Optima platformot, amely lehetővé teszi a felhasználók számára, hogy saját, specifikus használati esetekre szabott AI-teszteket hozzanak létre. A platform célja, hogy áthidalja a szakadékot a nagymértékben előre definiált, általános célú teljesítménytesztek és a valós alkalmazások eltérő igényei között. (The Decoder)

A rendszer támogatja a Hugging Face, Arize, Braintrust és Langfuse platformokról származó adatkészletek, valamint AI-ügynökök nyomkövetési adatainak használatát. Ha a felhasználó nem rendelkezik ilyen adatokkal, leírhatja a kívánt használati esetet, és mintákat adhat meg bemenetekre és kimenetekre, amelyeket az Optima kiegészít és tesztelhetővé alakít.

Értékelési módszerek és költségelemzés

Az Optima kétféle értékelési módszert kínál: objektív kritériumok alapján történő értékelést, vagy páros összehasonlítást. Ez utóbbi esetben a felhasználók először válaszpárokat értékelnek, majd a platform ebből vezeti le a teljes rangsort. A nyers modellminőség mellett a rendszer a feladatonkénti költséget és az időt is nyomon követi, így ellenőrizhetővé válik, hogy egy teljesítménybeli javulás indokolja-e a magasabb költséget vagy hosszabb feldolgozási időt.

Korai tesztelők tízszeres költségcsökkentést értek el pénzügyi és könyvelési ügynökök esetében, jelentős minőségromlás nélkül — közölte a mesterséges intelligencia-fejlesztő. A platform a felhasznált modellek tényleges tokenköltségét számolja fel, mindenféle felár nélkül. Az értékelések díja kritériumonként 0,125 dollár, a páros összehasonlítások pedig 0,375 dollárba kerülnek.

Átláthatóság és tesztelési eredmények

A rendszer minden teszt futtatása és értékelési kör elején egy becsült költség alapján egyenleget tart. Az Optima a teljesítménytesztek általános problémájára kínál megoldást: a különböző utasítások és beállítások jelentősen befolyásolhatják az eredményeket. A platform lehetővé teszi, hogy a tesztek pontosan tükrözzék a célzott képességeket és a valós alkalmazási forgatókönyveket.

A tesztek hasznossága attól függ, milyen precízen vannak definiálva a célképességek, mennyire reprezentatívak a tesztesetek, és hogyan implementálják az értékelést. Az Optima első tesztjei március végén zárultak.

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom