ÉlőUtoljára: 34 perceMa: 5
Kutatásfrissítve: 05:15

Astra közzétette a Frontier AEO Tracker-t, 161 kategóriában mér a modelleket

A felhasználók most 161 kategóriában összehasonlíthatják a frontier modellek AEO pontszámait, és láthatják, hogy egy kérdés átfogalmazása esetén a válaszok mennyire változnak – a Tracker 6 promptváltozaton alapul.

Astra közzétette a Frontier AEO Tracker-t, 161 kategóriában mér a modelleket
Fotó: National Cancer Institute / Unsplash
forrás: Latent Space·AI Forradalom szerk.·
Megosztás

Módszertan és lefedettség

A Tracker 6 promptváltozaton és 7 modellen fut, összesen 161 kategóriában, a kódoló ügynököktől az AI-podcastokig. Az eredményeket az Astra saját AEO-pontszámmal értékelte, és minden prompt-válasz pár nyilvánosan elérhető — írja a Latent Space.

Megfigyelt torzítások és forráshasználat

Az elemzés szerint a modellek gyakran a saját laboratóriumi termékeiket részesítik előnyben – például a Claude Code, a Codex vagy a Cursor. Az Astra által észlelt „soft bias” arra utal, hogy a modellek öncélú ajánlásokat adhatnak, bár a forrás ezt csak belső vizsgálat alapján állítja.

Kiemelt kategóriák és modellváltások

A 161 kategória közül 28-ban minden vizsgált modell ugyanazt az elsődleges ajánlatot adja, ami egységes dominanciát jelez. A Tracker rögzítette a modellgenerációk közti jelentős váltásokat is, például a Sol→Astra vagy az Opus→Fable átmeneteket, és elemzi, melyik labor milyen előnyökkel jár.

Források száma és hatékonyság

Az Anthropic modellek (Sol, Opus) több forrást használnak: a Sol mediánja 9, az Opus 11, míg az Astra csak 5 forrást idéz. Az Astra ezért sokkal kevésbé változtatja meg a válaszát, ha a kérdést csak enyhén átfogalmazzák.

A Latent Space szerint a 28 kategóriában egységes első választás a 161 közül a Tracker adataiban jelenik meg.

Forrás

Feldolgozott sajtóforrás·Latent Space

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom