ÉlőUtoljára: 3 perceMa: 16
Üzlet & Startupfrissítve: 09:15

200 millió dollárt gyűjtött az AI-rangsoroló Arena, új értékelési módszert vezet be

Az AI-modelleket értékelő Arena 200 millió dolláros Series B-körben 3,1 milliárd dolláros értékelést ért el, ami tíz hónap alatt csaknem megduplázódott.

200 millió dollárt gyűjtött az AI-rangsoroló Arena, új értékelési módszert vezet be
Fotó: Jonathan Wells / Unsplash
forrás: TechCrunch·AI Forradalom szerk.·
Megosztás

Az Arena, amely eredetileg 2023-ban indult az UC Berkeley kutatási projektjeként, ahol AI-modellek rangsorolását végezték közösségi alapon, 200 millió dolláros Series B-finanszírozást szerzett 3,1 milliárd dolláros értékelés mellett – közölte a cég csütörtökön. Ez azután történt, hogy a vállalat júniusban elérte a 100 millió dolláros éves bevételi szintet. A kört a Lightspeed Venture Partners és a Khosla Ventures vezette, olyan befektetőkkel, mint a Salesforce Ventures, a 01 Advisors, a Dell Technologies Capital, az Endeavor Catalyst, az a16z és a Felicis. (TechCrunch)

Az Arena korábban, januárban jelentett be egy 150 millió dolláros Series A-kört 1,7 milliárd dolláros értékelés mellett. Akkor az éves bevételük 30 millió dollár volt, ami azt jelenti, hogy az értékelésük mintegy tíz hónap alatt csaknem megduplázódott. Az Arena egy közösségi platformot kínál, amely a fogyasztók számára ingyenesen használható. A felhasználók promptokat adnak meg, vagy különféle projekteket kérnek, majd értékelik, melyik modell teljesít jobban. Az Arena állítása szerint havonta több tízmillió látogatójuk van.

Új értékelési módszerek az AI-tesztelés utánzása ellen

Tavaly szeptemberben vezették be kereskedelmi terméküket, az AI Evaluations-t, amely részletes teljesítményelemzést nyújt a modellfejlesztők és vállalatok számára a közösségi visszajelzések alapján. Az időzítés tökéletesnek bizonyult. Idén az AI-fejlesztők felismerték, hogy modelljeik „kijátszhatják” a teljesítményteszt teszteket, jó pontokat szerezve anélkül, hogy azt érdemben megszolgálnák. Ezzel párhuzamosan a vállalatoknak segítségre volt szükségük, hogy melyik modell felel meg leginkább saját belső igényeiknek, ahelyett, hogy csak a szabványos benchmarkokra támaszkodnának.

„Az AI gyorsabban fejlődik, mint ahogy képesek vagyunk értékelni, és a statikus teljesítménytesztek összeomlanak, amint a modellek felismerik, hogy tesztelik őket” – áll a cég közleményében. „A világnak szüksége van egy semleges harmadik félre, amely méri, mennyire biztonságos és összehangolt valójában az AI, amikor valós emberek kezébe kerül. Az Arena ma ezt a szerepet tölti be.”

Az OpenAI modelljei vezetik az új ranglistát

Ennek érdekében az Arena új kategóriát is hozzáadott ranglistájához: a „megbízhatóságot” (alignment). Itt a modelleket olyan szempontok alapján rangsorolják, mint az illetéktelen cselekvés (olyan feladatok végrehajtása, amire nem kérték őket), a hamisítás (tévesen tulajdonítanak kijelentéseket vagy tényeket a téves forrásnak), és az úgynevezett „megtévesztő teljesítés” (hazudozás arról, hogy olyan feladatokat végeztek el, amelyeket nem). Jelenleg az OpenAI több modellje áll az új, előzetes megbízhatósági ranglista élén, míg a Claude Opus 5.5 és a Claude Fable a hatodik, illetve kilencedik helyen szerepel.

Forrás

Feldolgozott sajtóforrás·TechCrunch

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom