Az NVIDIA új eszköze, az AIPerf, pontosabbá teszi a modelltesztelést
Az NVIDIA AIPerf multiprocess architektúrával előzi meg a kliensoldali szűk keresztmetszeteket nagy egyidejűségű LLM-tesztelés során, leváltva a korábbi GenAI-Perf eszközt.

Az NVIDIA bemutatta az AIPerf nevű új eszközt, amely a korábbi GenAI-Perf utódjaként skálázható LLM-tesztelést tesz lehetővé. Az AIPerf multiprocess architektúrával rendelkezik, amely megakadályozza, hogy a tesztelést végző kliens váljon szűk keresztmetszetté nagy egyidejűségű terhelés esetén — közölte az NVIDIA Developer Blog.
Az új eszköz több mint 15 végponttípust támogat, beleértve a csevegést, válaszokat, NIM rangsorokat és képgenerálást. Emellett olyan nyilvános adathalmazokat is képes kezelni, mint a ShareGPT, valamint a Mooncake, Baseten és WEKA AgentX nyomkövetési formátumokat, lehetővé téve a valósághű munkaterhelés-tesztelést. Az AIPerf konfigurálható érkezési mintázatokat kínál, mint például állandó, Poisson és gamma eloszlásokat, állítható burstiness-szel, így a mérnökök a termelési forgalom jellemzőihez igazíthatják a terhelést.
Mérőszámok és GPU-telemetria
A futtatások során az AIPerf olyan alapvető metrikákat jelent, mint az első tokenig eltelt idő (TTFT), az egyes tokenek közti késleltetés (ITL), a kérés késleltetése és a kimeneti tokenek átviteli sebessége. Ezeket a mérőszámokat százalékos bontásban, valamint GPU-telemetriával együtt jeleníti meg, amennyiben a DCGM vagy a pynvml elérhető.
A GenAI-Perf utódja
Az AIPerf egy teljesen újratervezett rendszer, amely a GenAI-Perf tapasztalataiból merítve született. Az új architektúra szakít a korábbi, egyfolyamatos (single-process) megközelítéssel, amely a Python GIL korlátai miatt nem tudta kielégítően szaturálni a szervereket nagy terhelés alatt. Az AIPerf több folyamatot használ: a feldolgozó folyamatok generálják a terhelést, a különálló rekord-feldolgozó szolgáltatások kezelik az eredményeket, és mindezt ZMQ koordinálja. Ez a struktúra pontosabb szervermérést tesz lehetővé.
Gyakorlati példa: Qwen3-0.6B tesztelése vLLM-mel
Az eszköz használatának demonstrálására az NVIDIA egy Qwen3-0.6B modellt futtatott vLLM-en keresztül. A teszt során az AIPerf rögzítette a kérés késleltetését, az átviteli sebességet és a GPU-teljesítményt. Az eredmények egy interaktív irányítópulton jelennek meg, amely részletes betekintést nyújt a futás előrehaladásába és a mért metrikák eloszlásába.
Az AIPerf-et az NVIDIA Nemotron táplálja, és olyan keretrendszerekkel integrálható, mint a vLLM és a SGLang. A fejlesztők az AIPerf-tutorialok segítségével mélyülhetnek el a fejlettebb tesztelési forgatókönyvekben.