ÉlőUtoljára: 2 perceMa: 9
Eszközökfrissítve: 02:15

Az NVIDIA új eszköze, az AIPerf, pontosabbá teszi a modelltesztelést

Az NVIDIA AIPerf multiprocess architektúrával előzi meg a kliensoldali szűk keresztmetszeteket nagy egyidejűségű LLM-tesztelés során, leváltva a korábbi GenAI-Perf eszközt.

Az NVIDIA új eszköze, az AIPerf, pontosabbá teszi a modelltesztelést
Fotó: Mariia Berezovsky / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

Az NVIDIA bemutatta az AIPerf nevű új eszközt, amely a korábbi GenAI-Perf utódjaként skálázható LLM-tesztelést tesz lehetővé. Az AIPerf multiprocess architektúrával rendelkezik, amely megakadályozza, hogy a tesztelést végző kliens váljon szűk keresztmetszetté nagy egyidejűségű terhelés esetén — közölte az NVIDIA Developer Blog.

Az új eszköz több mint 15 végponttípust támogat, beleértve a csevegést, válaszokat, NIM rangsorokat és képgenerálást. Emellett olyan nyilvános adathalmazokat is képes kezelni, mint a ShareGPT, valamint a Mooncake, Baseten és WEKA AgentX nyomkövetési formátumokat, lehetővé téve a valósághű munkaterhelés-tesztelést. Az AIPerf konfigurálható érkezési mintázatokat kínál, mint például állandó, Poisson és gamma eloszlásokat, állítható burstiness-szel, így a mérnökök a termelési forgalom jellemzőihez igazíthatják a terhelést.

Mérőszámok és GPU-telemetria

A futtatások során az AIPerf olyan alapvető metrikákat jelent, mint az első tokenig eltelt idő (TTFT), az egyes tokenek közti késleltetés (ITL), a kérés késleltetése és a kimeneti tokenek átviteli sebessége. Ezeket a mérőszámokat százalékos bontásban, valamint GPU-telemetriával együtt jeleníti meg, amennyiben a DCGM vagy a pynvml elérhető.

A GenAI-Perf utódja

Az AIPerf egy teljesen újratervezett rendszer, amely a GenAI-Perf tapasztalataiból merítve született. Az új architektúra szakít a korábbi, egyfolyamatos (single-process) megközelítéssel, amely a Python GIL korlátai miatt nem tudta kielégítően szaturálni a szervereket nagy terhelés alatt. Az AIPerf több folyamatot használ: a feldolgozó folyamatok generálják a terhelést, a különálló rekord-feldolgozó szolgáltatások kezelik az eredményeket, és mindezt ZMQ koordinálja. Ez a struktúra pontosabb szervermérést tesz lehetővé.

Gyakorlati példa: Qwen3-0.6B tesztelése vLLM-mel

Az eszköz használatának demonstrálására az NVIDIA egy Qwen3-0.6B modellt futtatott vLLM-en keresztül. A teszt során az AIPerf rögzítette a kérés késleltetését, az átviteli sebességet és a GPU-teljesítményt. Az eredmények egy interaktív irányítópulton jelennek meg, amely részletes betekintést nyújt a futás előrehaladásába és a mért metrikák eloszlásába.

Az AIPerf-et az NVIDIA Nemotron táplálja, és olyan keretrendszerekkel integrálható, mint a vLLM és a SGLang. A fejlesztők az AIPerf-tutorialok segítségével mélyülhetnek el a fejlettebb tesztelési forgatókönyvekben.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom