ÉlőUtoljára: az iméntMa: 20
Kutatásfrissítve: 17:15

Az AI-ügynököket gyorsítja meg a Together AI új ThunderAgent rendszere

Az új ThunderAgent rendszer akár 2,5-szeres sebességnövekedést és lineáris skálázhatóságot ígér az AI-ügynökök inferenciájában a KV-cache-probléma kiküszöbölésével.

Az AI-ügynököket gyorsítja meg a Together AI új ThunderAgent rendszere
Fotó: Aleksandar Savic / Unsplash
forrás: Together AI·AI Forradalom szerk.·
Megosztás

Az AI-ügynökök, mint a Claude Code vagy a Codex, egyre komplexebb feladatokat végeznek, gyakran több tucat lépésben. Képzésükhöz nagy mennyiségű szintetikus adat szükséges, amihez nagy sebességű, egyidejű ügynök-inferencia kell. A hagyományos rendszerek, mint a SGLang vagy a vLLM, ebben a kontextusban a KV-cache-problémával küzdenek, ami lassulást és erőforspazarlást okoz.

A probléma lényege, hogy az ügynökök felváltva végeznek GPU-intenzív feldolgozást és GPU-üresjárati várakozást (például egy eszközhívás visszatérésére). Nagy párhuzamosság esetén a rendszerek gyakran kiürítik a KV-cache-t, hogy helyet csináljanak más kéréseknek. Amikor az ügynök folytatná, a gyorsítótárat újra kell számolni, ami drasztikusan lassítja a folyamatot.

ThunderAgent: Program-szintű ütemezés

A ThunderAgent egy új, könnyű ütemezőréteg, amely az ügynök-kliensek és az inferencia-motorok között helyezkedik el. Minden ügynök-munkafolyamatot egy ütemezhető programként kezel, figyelve annak fázisát, KV-cache-igényét és csomóponti elhelyezését. Ezzel kiküszöböli a KV-cache-thrashing jelenségét.

A rendszer memórianyomás esetén szelektíven felfüggeszti az alacsony prioritású folyamatokat, csökkentve a cache-ért versenyző programok számát. Ez növeli a fennmaradó folyamatok KV-cache-találati arányát és csökkenti a késleltetést. A felfüggesztett feladatokat egy globális várólistán keresztül az erőforrásokkal legjobban rendelkező csomópontra irányítja, kiegyensúlyozva a terhelést.

Eredmények és kompatibilitás

A Together AI belső szintetikus adatgeneráló rendszerén végzett tesztek szerint a ThunderAgent akár 2,5-szeres egyszemélyes átviteli sebességet ért el, és 2,4-szeres gyorsulást mutatott egy 8 csomópontos klaszteren, közel lineáris skálázhatósággal 16-tól 64 GPU-ig. Emellett durván 10-szeresére csökkentette a P50 késleltetést nagy párhuzamosság mellett.

A ThunderAgent könnyen integrálható: mindössze egy program_id mezőre van szükség, kompatibilis az OpenAI interfészével, és együttműködik meglévő optimalizálásokkal, mint a spekulatív dekódolás. A kutatást a Georgia Institute of Technology, az University of Illinois Urbana-Champaign, a Carnegie Mellon University és a Together AI kutatói végezték, és az ICML 2026 konferencián Spotlight-papírként fogadták el.

Forrás

Feldolgozott sajtóforrás·Together AI

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom