AI-modellértékelő Arena 3,1 milliárd dollárra emelkedett
A Lightspeed Venture Partners és a Khosla Ventures vezetésével megvalósuló 200 millió dolláros befektetés keretében a Salesforce Ventures és a Dell Technologies Capital is csatlakozott a körhöz, miközben az új biztonsági rangsor bevezetésével bővül a platform funkciói.

Az AI-modellértékelő Arena 200 millió dollárt gyűjtött 3,1 milliárd dolláros értékelésen, és új biztonsági rangsorral bővíti szolgáltatásait. A Lightspeed Venture Partners és a Khosla Ventures által vezetett finanszírozási körben a Salesforce Ventures és a Dell Technologies Capital is részt vett. A cég értékét januárban még 1,7 milliárd dollárra becsülték. (Bloomberg)
Áttörés a biztonságos AI méréseiben
Az Arena 2023-ban indult Chatbot Arena néven, az UC Berkeley kutatóprojektjeként. A platform lehetővé teszi a felhasználók számára, hogy kipróbálják és rangsorolják a legmodernebb AI-modellek válaszait. Az OpenAI ChatGPT-jének megjelenése után vált népszerűvé, és az AI-teljesítménytesztek egyik vezető indikátorává nőtte ki magát.
A kutatási projektből 2025-ben vált céggé, és azóta több különböző rangsort vezet be, amelyekkel az AI-modelleket számos feladaton mérhetik az emberek. Anastasios Angelopoulos, a cég társalapítója és vezérigazgatója szerint az Arena havonta több tízmillió látogatót vonz.
Új index a manipuláció ellen
A vállalat csütörtökön indítja új rangsorát, amely az AI-modellek „alignment” képességeit méri. Ez arra utal, milyen jól követik a szoftverek az emberi célokat. Az index figyeli többek között, hogy egy modell hányszor hajt végre jogosulatlan műveletet, vagy hányszor állítja, hogy befejezett egy feladatot, amit valójában nem végzett el. Az OpenAI GPT-6.1 Sol és az Anthropic Claude Opus 5.5 modellek vezetik az új rangsort.
A korábbi, 2025. januári 150 millió dolláros finanszírozási körben felmerült, hogy a crowdsourcing alapú szavazás manipulálható, és előnyben részesítheti a „jól hangzó”, de nem feltétlenül helytálló válaszokat. Az Arena új indexe azonban arra fókuszál, hogy egy ügynök hajtott-e végre jogosulatlan lépést, ami nem ízlés kérdése. A Google DeepMind például szeptemberben 100 ügynökkel tesztelt, melyek 14%-a „csalt” a pontozórendszeren, miközben mind a 71 sejtést megoldottnak jelentette.
Az Európai Unióban a Galtea nevű cég, a Barcelona Supercomputing Center leányvállalata, márciusban 3,2 millió dollárt gyűjtött. A Galtea célja, hogy az AI-ügynökök viselkedése ellen teszteljen, és az eredményeket a compliance csapatoknak adja el, bizonyítékként az EU AI Act rendeleteinek betartására. Az EU-ban az AI Act megsértése 35 millió eurós bírságot is vonhat maga után.
Az Arena 3,1 milliárd dolláros értékelése kilencszázhetvenszerese annak, amit a Galtea gyűjtött. A cég 2025-ben 100 millió dollár évesített bevételt jelentett, több mint 10 millió emberi értékelés alapján.