ÉlőUtoljára: 5 perceMa: 32
Modellek & LLMfrissítve: 17:16

Bemutatta az Agent Ultra-t az Exa, a mély kutatásokra épülő AI-ügynököt

Az Exa Agent Ultra négy kutatási teljesítményteszten is felülmúlja az Opus 5.5, a GPT-6 Astra és a Perplexity Agent modelljeit. A rendszer több ezer forrást dolgoz fel, a feladatok elvégzése általában 30 percet, de akár 3 órát is igénybe vehet.

Bemutatta az Agent Ultra-t az Exa, a mély kutatásokra épülő AI-ügynököt
Fotó: National Cancer Institute / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

Az Agent Ultra egy feladatot több alfeladatra bont, és párhuzamosan több alügynököt rendel hozzá, amelyek egyszerre több tartományban kutathatnak. Az ügynök a legfejlettebb modelleket a legkritikusabb lépésekhez rendeli, míg a gyorsabb modelleket ott használja, ahol elegendőek. Az „ultra” mód a legnagyobb számítási kapacitást igényli, és a dokumentáció szerint hosszabb ideig fut, hogy a lehető legteljesebb eredményeket szolgáltassa. A komplex feladatok általában 30 perc alatt végezhetők el, de a rendkívül nehéz feladatok akár 3 órát is igénybe vehetnek. (MarkTechPost)

Teljesítményteszt eredmények és költséghatékonyság

Az Exa által közölt adatok szerint az Agent Ultra kiemelkedő eredményeket ért el a teszteken. A WANDR (soft recall) mérésen 81,4%-ot teljesített, ami 12,6%-kal jobb az Opus 5.5-nél, miközben a költsége fele annak. A DeepSearchQA (F1) teszten 93,9%-ot ért el, 4,7%-kal múlva felül a Perplexityt, és 46%-kal olcsóbban, mint a GPT-6 Astra. A WideSearch (row-level F1) teszten 58,9%-ot, a Company Find-All feladaton pedig átlagosan 2451 entitást talált feladatonként, ami jelentős, 1579%-os növekedés az Opus 5.5-höz képest, ráadásul a legalacsonyabb egységköltséggel.

Eredmények értelmezése és célcsoport

A WANDR egy 500 széles és mély adatgyűjtési feladatból álló teljesítményteszt, amelyet a Perplexity fejlesztett ki. A DeepSearchQA a Google DeepMind 900 utasítást tartalmazó, több lépéses keresési benchmarkja, míg a WideSearch az információgyűjtés szélességét teszteli. Fontos megjegyezni, hogy ezek az eredmények az Exa saját jelentései, és még nem erősítették meg független tesztek. Az Agent Ultra elsősorban modellfejlesztőknek, pénzügyi szolgáltatóknak és értékesítési csapatoknak szól, segítve őket képzési adatok összeállításában, piaci térképek építésében és ügyféllisták gazdagításában.

Az Agent Ultra a standard Agent futtatási végponton keresztül érhető el, és támogatja az outputSchema, input.data és streaming funkciókat. Az API használata alapvetően mértékegységenként történik, alapértelmezetten legfeljebb 20 dollár futásonként, de ez az összeg 1 és 100 dollár között állítható. A futási idő maximuma 300 másodperctől 10 800 másodpercig (3 óra) konfigurálható. Az ügynök nem nyílt forráskódú, és nem telepíthető helyben, csak felhőalapú API-ként érhető el. A futási idő maximuma 10 800 másodpercig állítható.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom