Az AI-ügynököket gyorsítja meg a Together AI új ThunderAgent rendszere
Az új ThunderAgent rendszer akár 2,5-szeres sebességnövekedést és lineáris skálázhatóságot ígér az AI-ügynökök inferenciájában a KV-cache-probléma kiküszöbölésével.

Az AI-ügynökök, mint a Claude Code vagy a Codex, egyre komplexebb feladatokat végeznek, gyakran több tucat lépésben. Képzésükhöz nagy mennyiségű szintetikus adat szükséges, amihez nagy sebességű, egyidejű ügynök-inferencia kell. A hagyományos rendszerek, mint a SGLang vagy a vLLM, ebben a kontextusban a KV-cache-problémával küzdenek, ami lassulást és erőforspazarlást okoz.
A probléma lényege, hogy az ügynökök felváltva végeznek GPU-intenzív feldolgozást és GPU-üresjárati várakozást (például egy eszközhívás visszatérésére). Nagy párhuzamosság esetén a rendszerek gyakran kiürítik a KV-cache-t, hogy helyet csináljanak más kéréseknek. Amikor az ügynök folytatná, a gyorsítótárat újra kell számolni, ami drasztikusan lassítja a folyamatot.
ThunderAgent: Program-szintű ütemezés
A ThunderAgent egy új, könnyű ütemezőréteg, amely az ügynök-kliensek és az inferencia-motorok között helyezkedik el. Minden ügynök-munkafolyamatot egy ütemezhető programként kezel, figyelve annak fázisát, KV-cache-igényét és csomóponti elhelyezését. Ezzel kiküszöböli a KV-cache-thrashing jelenségét.
A rendszer memórianyomás esetén szelektíven felfüggeszti az alacsony prioritású folyamatokat, csökkentve a cache-ért versenyző programok számát. Ez növeli a fennmaradó folyamatok KV-cache-találati arányát és csökkenti a késleltetést. A felfüggesztett feladatokat egy globális várólistán keresztül az erőforrásokkal legjobban rendelkező csomópontra irányítja, kiegyensúlyozva a terhelést.
Eredmények és kompatibilitás
A Together AI belső szintetikus adatgeneráló rendszerén végzett tesztek szerint a ThunderAgent akár 2,5-szeres egyszemélyes átviteli sebességet ért el, és 2,4-szeres gyorsulást mutatott egy 8 csomópontos klaszteren, közel lineáris skálázhatósággal 16-tól 64 GPU-ig. Emellett durván 10-szeresére csökkentette a P50 késleltetést nagy párhuzamosság mellett.
A ThunderAgent könnyen integrálható: mindössze egy program_id mezőre van szükség, kompatibilis az OpenAI interfészével, és együttműködik meglévő optimalizálásokkal, mint a spekulatív dekódolás. A kutatást a Georgia Institute of Technology, az University of Illinois Urbana-Champaign, a Carnegie Mellon University és a Together AI kutatói végezték, és az ICML 2026 konferencián Spotlight-papírként fogadták el.