ÉlőUtoljára: 8 perceMa: 31
Modellek & LLMfrissítve: 22:16

2,5-szeres sebességet hoz az NVIDIA NIM 2.0.12 a Nemotron 3 Ultra kiszolgálásában

Az NVIDIA NIM 2.0.12 optimalizált kiszolgálórendszere akár 2,5-szeres rendszerátviteli sebességet ér el 4x B200 GPU-konfiguráción, szemben az NIM nélküli alapverzióval, így több felhasználót képes kiszolgálni.

2,5-szeres sebességet hoz az NVIDIA NIM 2.0.12 a Nemotron 3 Ultra kiszolgálásában
Fotó: Growtika / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

Az NVIDIA bemutatta az NIM 2.0.12 frissítését, amely jelentősen növeli a Nemotron 3 Ultra nagyméretű nyelvi modell (LLM) kiszolgálási sebességét. Az optimalizált rendszer akár 2,5-szeres átviteli sebességet kínál egy 4x B200 GPU-konfiguráción, ami közvetlenül több egyidejű felhasználót jelent azonos interaktivitási szint mellett. (Nvidia Developer)

Az új NIM-verzió kulcsa a teljes „full-stack” optimalizálásban rejlik, amely magában foglalja az autotuned kerneleket, a tenzorpárhuzamosságot, a prefix- és állapot-újrahasznosítást, valamint a spekulatív dekódolást. Ezek az elemek együttesen 1997 tokent másodpercenként érnek el, miközben a felhasználónkénti 50 tranzakció/másodperc (TPS) és a 20 ms-os inter-token késleltetési célkitűzés is teljesül.

Az NIM egy „deployable microservice”-ként csomagolja a modell- és GPU-specifikus beállításokat, standard API-kkal és egy vállalati szintű konténer-életciklussal az NVIDIA AI Enterprise részeként. Ez leegyszerűsíti a fejlesztők dolgát, akiknek nem kell a nulláról konfigurálniuk a rendszert, hanem egy validált kiindulási pontot kapnak, miközben lehetőségük van saját forgalmukkal benchmarkolni az NIM teljesítményét az NVIDIA AIPerf eszközével.

A cikkben bemutatott teljesítményteszt-teszt egy 4x B200 rendszeren, 64K kontextussal, 400 tokenes válaszokkal, 76%-os KV-újrahasznosítással és 50 TPS/felhasználó célkitűzéssel zajlott. Az NIM nélküli alapverzió (NIM Off) 718 tokent/másodperc sebességet ért el, míg az optimalizált NIM 2.0.12 (NIM On) 1997 tokent/másodpercet, ami több mint 2,5-szeres növekedés.

Az optimalizálási rétegek közé tartozik a precíziós és modellspecifikus kernelek, a párhuzamos végrehajtás (tenzor- és szakértőalapú párhuzamosság), a prefix- és állapot-újrahasznosítás (cache-elés), valamint a scheduler, batching és memória-optimalizálás. Az MTP (Mixture-of-Experts) spekulatív dekódolás további előnyöket kínál az elfogadási aránytól és a rendelkezésre álló memória méretétől függően.

A fejlesztők az NVIDIA AI Enterprise-on keresztül érhetik el az NIM-et, és az AIPerf eszközzel saját forgalmukkal tesztelhetik a teljesítményt, hogy kiválasszák a legmegfelelőbb konfigurációt a késleltetési követelményekhez. A Nemotron 3 Ultra NIM letölthető az NGC-ről, vagy kipróbálható a hosted API-n keresztül.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom