ÉlőUtoljára: az iméntMa: 7
Hardver & Infrafrissítve: 02:15

Az NVIDIA Dynamo másodpercekre csökkenti az LLM-kiesés helyreállítási idejét

A GPU Memory Service (GMS) segítségével a modell súlyai megmaradnak a folyamatok meghibásodása során, így az élettartamuk független a motorfolyamatoktól, ami lehetővé teszi a közel azonnali átkapcsolást.

Az NVIDIA Dynamo másodpercekre csökkenti az LLM-kiesés helyreállítási idejét
Fotó: Umberto / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

Az NVIDIA Dynamo új árnyékmotor-helyreállítási funkciója lehetővé teszi a közel azonnali átkapcsolást egy meghibásodott LLM-motor esetén. A GPU Memory Service (GMS) segítségével a súlyok (weights) megmaradnak a folyamat meghibásodásai között, és élettartamuk független a motorfolyamatoktól. A GMS elkülönítetten kezeli a súlyok fizikai GPU-memóriáját, lehetővé téve több motor számára ugyanazon súlyok másolás nélküli használatát, ami gyors motor-helyreállítást és minimális HBM-terhelést biztosít.

A GLM-5.2 modellel, NVIDIA B200 csomópontokon végzett tesztek kimutatták, hogy az árnyékmotor-helyreállítás 283 másodpercről (hideg újraindítás) 7,3 másodpercre csökkentette az átkapcsolási időt. Ez drámaian javítja az első válaszig eltelt időt (TTFT), a dekódolási sebességet és a szolgáltatási szint-megállapodások (SLA) betartását egy folyamatmeghibásodás után — közölte az NVIDIA Developer Blog.

Átkapcsolási idők és teljesítményjavulás

A nagy nyelvi modellek (LLM) motorfolyamatai gyakran tapasztalnak helyrehozható szoftverhibákat, beleértve a folyamat-összeomlásokat, a CUDA-hibákat és a tranziens kollektív hibákat. Ilyen esetekben a hardver, a meghajtók és a csomópont egészséges marad; csak a hibás állapotot tartalmazó folyamat veszik el, és egy csere-motor általában ugyanazon a GPU-n indulhat el. Azonban a friss motornak ismét el kell végeznie a teljes inicializálási folyamatot, ami jelentős időt vehet igénybe.

Az árnyékmotor-helyreállítás működése

Az árnyékmotor-helyreállítás a persistent GPU-memória, egy előre felmelegített készenléti motor és a worker-szintű koordináció kombinációja. A GPU Memory Service (GMS) a motorfolyamattól függetlenül kezeli a memóriaterületeket, például a súlyokat. Ennek eredményeként egy új motor ugyanazon a GPU-n csatlakozhat a meglévő memóriához. Ha az aktív folyamat meghibásodik, az árnyékmotor másodperceken belül átveszi az irányítást, miközben az újraindítás a háttérben, a kiszolgálási útvonalon kívül történik.

A tesztek során egy két motoros GLM-5.2 telepítés egyik workerét szándékosan leállították. Az árnyékmotor-helyreállítás nélkül a fennmaradó workernek kellett kezelnie az összes forgalmat a 283 másodperces hideg újraindítás alatt, ami növelte a TTFT-t és csökkentette a felhasználónkénti dekódolási sebességet. Az árnyékmotor-helyreállítással egy második worker 7,3 másodperc alatt állt újra szolgálatba, ami közel 39-szeres gyorsulást jelentett, minimalizálva a szolgáltatás minőségének zavarát.

A GMS a CUDA Virtual Memory Management API-ra épül, amely lehetővé teszi a fizikai GPU-memória és a hozzá kapcsolódó virtuális címek élettartamának független kezelését. Ez azt jelenti, hogy a súlyok akkor is megmaradnak a memóriában, ha a motorfolyamat leáll, így egy új motor azonnal hozzáférhet hozzájuk.

A GMS integrálása az inference keretrendszerekbe viszonylag egyszerű. A vLLM, SGLang és az NVIDIA TensorRT-LLM egyéni torch.cuda.CUDAPluggableAllocator segítségével integrálja a GMS-t. A GMS jelenleg előzetes verzióban érhető el, és aktívan fejlesztik a KV-gyorsítótár támogatását is.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom