ÉlőUtoljára: 1 perceMa: 8
Kutatásfrissítve: 03:15

Valós idejű koordinációval verte a Claude Opus 4.8-at az új AI-ügynökrendszer

Az AgentRadio nevű új rendszer lehetővé teszi az AI-ügynökök számára, hogy feladatok végrehajtása közben is kommunikáljanak, megduplázva a kódolási feladatok pontosságát a SWE-Atlas QnA teljesítményteszten.

Valós idejű koordinációval verte a Claude Opus 4.8-at az új AI-ügynökrendszer
Fotó: Testalize.me / Unsplash
forrás: VentureBeat·AI Forradalom szerk.·
Megosztás

Ahogy a vállalati kódok egyre nagyobbak, az azokat elemző AI-ügynökök elakadnak a hosszú feladatoknál, amelyek több interakciót és eszközhasználatot igényelnek. A feladatok megosztása ügynökcsapatok között magától értetődőnek tűnik, de bevezet egy végzetes hibát: a legtöbb több-ügynökös rendszer nem arra lett tervezve, hogy az ügynökök feladat közben, valós időben koordinálják egymást. (VentureBeat)

Ezt a problémát megoldva a Coral AI Labs és több egyetem kutatói bemutatták az AgentRadio-t, egy aszinkron üzenetküldő réteget, amely lehetővé teszi az ügynökök számára, hogy kommunikáljanak végrehajtási lépéseik között anélkül, hogy fő munkájukat megszakítanák. A valós vállalati alkalmazásokban, ahol az alfeladatok erősen összefüggnek, ez az architektúra lehetővé teszi az ügynökök számára, hogy menet közben korrigáljanak, ahelyett, hogy halott végű utakon folytatnák, amíg egy formális felülvizsgálati fázis el nem érkezik.

A hosszú feladatokat vizsgáló teljesítményteszten, amely éles kódrepository-kon futott, az AgentRadio által támogatott ügynökcsapat közel megduplázta a pontosságot négy, függetlenül dolgozó Claude Code ügynök esetében. Emellett felülmúlt egy fejlettebb modelleken futó, egyetlen ügynököt is. Az AI-szakemberek számára az AgentRadio azt mutatja, hogy a megfelelő koordinációs struktúra felülmúlhatja a nyers számítási kapacitást és a modell méretét.

A kódok megértésének kihívása

Az LLM-alapú ügynökök egyre inkább képesek kezelni a hosszú feladatokat, amelyek különböző eszközökkel és környezetekkel való interakciót igényelnek. A kódok megértése ennek a kihívásnak egy extrém változata. Megköveteli, hogy egy AI-ügynök felépítse a szoftvert, végrehajtsa azt, nyomon kövesse a végrehajtási útvonalakat több fájlon keresztül, és hosszú időn át szintetizálja a bizonyítékokat. Ezekben a feltételekben az egyetlen ügynökrendszerek általában egy „lefedettségi probléma” miatt törnek össze.

„Egyetlen ügynök egy soros útvonalon halad a repository-ban” – magyarázták a VentureBeatnek Xinxing Ren, Caelum Forder és Peter Carroll, az AgentRadio papír társszerzői. Ahogy a kontextusa növekszik, „az eredeti tervet nehezebb felülvizsgálni, és a vizsgálat késői szakaszában tett felfedezések nem mindig terjednek tovább.” A modell általában képes végrehajtani az egyes lépéseket, de „a nehéz rész az, hogy minden kötelezettséget, függőséget és ellentmondásos bizonyítékot aktívan tartsunk egy hosszú vizsgálat során.”

A SWE-Atlas QnA teljesítményteszt eredményei

Az egyik teljesítményteszt, amely segít mérni az AI teljesítményét nagy kódbase-eken, a SWE-Atlas QnA. Ez a teljesítményteszt hosszú, természetes nyelvű kérdésekből áll, amelyeket éles, gyártási repository-kon tesznek fel. A feladatokat nem lehet pusztán a kód feltárásával megoldani. Az AI-ügynököknek futtatniuk kell a szoftvert és több parancsot kell végrehajtaniuk a válaszok megtalálásához. A kutatócsoport kísérletei szerint egyetlen Claude Code példány, amely Opus 4.6-on fut, csak az ilyen feladatok 32,3%-át oldja meg. Egy újabb, fejlettebb modellre, mint az Opus 4.8-ra való frissítés csak 57,2%-os sikerrátát eredményez.

Egy természetes orvosság a munkaterhelés több ügynök közötti elosztása, lehetővé téve, hogy mindegyik kisebb, tisztább kontextussal dolgozzon. A több-ügynökös megoldások jelentős teljesítménynövekedést biztosíthatnak, ha a feladatok tisztán bonthatók, azaz külön megoldhatók és a végén egyesíthetők. A kódok megértése azonban ritkán bontható tisztán. Az alfeladatok erősen összefüggnek. Egy kritikus konfigurációs fájl vagy egy egyik ügynök által feltárt hiba teljesen átírhatja vagy átirányíthatja a másik ügynök teljes vizsgálati útvonalát. Ezen függőségek miatt az ügynököknek valós időben kell koordinálniuk, tárgyalniuk és megosztaniuk a köztes felfedezéseket.

Az AgentRadio működése

A munka és a figyelés kölcsönös kizárásának feloldására a kutatók kifejlesztették az AgentRadio-t, egy aszinkron üzenetküldő réteget, amelyet közvetlenül a meglévő kódoló-ügynök rendszerekhez lehet csatlakoztatni. Az AgentRadio három primitívet biztosít az ügynököknek: a `create_thread` primitív megnyit egy beszélgetést a részt vevő ügynökök között, a `send_message` primitív hozzáad egy üzenetet egy szálhoz anélkül, hogy blokkolná a küldő ügynököt, a `wait_for_mention` primitív pedig blokkolja a folyamatot, amíg egy hívót említő üzenet nem érkezik. Ez a trió lehetővé teszi az ügynökök számára a „passzív tudatosság” állapotát, ahol folytathatják elsődleges feladataikat, miközben a háttérben üzeneteket küldenek és frissítik tudásukat. Az AgentRadio kódja az Apache 2.0 licenc alatt érhető el a GitHubon. Úgy tervezték, hogy könnyű legyen, és ne igényeljen közvetlen módosításokat az alapul szolgáló ügynök rendszereken, mint a Claude Code vagy a Codex CLI.

Az architektúra két fő részből áll: az üzenetszerverből, amely központi hubként működik, és a harness-oldali integrációból, ahol az ügynökök három egyszerű shell szkripten keresztül kommunikálnak a szerverrel. Az ügynököknek futtatniuk kell egy figyelőt a háttérben, és az üzeneteket a megadott szkripteken keresztül kell küldeniük. Az integrációhoz egy „vékony adapterre” van szükség, amely elindítja a munkásokat, hozzárendeli az identitásokat, összekapcsolja őket a megosztott szerverrel, és kezeli a végső szintézist.

Az AgentRadio valós használatának validálására a kutatók 124 feladatot teszteltek a SWE-Atlas QnA benchmarkból. A tesztek olyan területeket fedtek le, mint a rendszertervezés, gyökérok-elemzés, biztonság és API integráció. A kutatók Claude Opus 4.6-ot és DeepSeek-et használtak.

Háttér: Claude magyarul: mi fér bele az ingyenes keretbe

Forrás

Feldolgozott sajtóforrás·VentureBeat

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom