Az NVIDIA Dynamo másodpercekre csökkenti az LLM-kiesés helyreállítási idejét
A GPU Memory Service (GMS) segítségével a modell súlyai megmaradnak a folyamatok meghibásodása során, így az élettartamuk független a motorfolyamatoktól, ami lehetővé teszi a közel azonnali átkapcsolást.

Az NVIDIA Dynamo új árnyékmotor-helyreállítási funkciója lehetővé teszi a közel azonnali átkapcsolást egy meghibásodott LLM-motor esetén. A GPU Memory Service (GMS) segítségével a súlyok (weights) megmaradnak a folyamat meghibásodásai között, és élettartamuk független a motorfolyamatoktól. A GMS elkülönítetten kezeli a súlyok fizikai GPU-memóriáját, lehetővé téve több motor számára ugyanazon súlyok másolás nélküli használatát, ami gyors motor-helyreállítást és minimális HBM-terhelést biztosít.
A GLM-5.2 modellel, NVIDIA B200 csomópontokon végzett tesztek kimutatták, hogy az árnyékmotor-helyreállítás 283 másodpercről (hideg újraindítás) 7,3 másodpercre csökkentette az átkapcsolási időt. Ez drámaian javítja az első válaszig eltelt időt (TTFT), a dekódolási sebességet és a szolgáltatási szint-megállapodások (SLA) betartását egy folyamatmeghibásodás után — közölte az NVIDIA Developer Blog.
Átkapcsolási idők és teljesítményjavulás
A nagy nyelvi modellek (LLM) motorfolyamatai gyakran tapasztalnak helyrehozható szoftverhibákat, beleértve a folyamat-összeomlásokat, a CUDA-hibákat és a tranziens kollektív hibákat. Ilyen esetekben a hardver, a meghajtók és a csomópont egészséges marad; csak a hibás állapotot tartalmazó folyamat veszik el, és egy csere-motor általában ugyanazon a GPU-n indulhat el. Azonban a friss motornak ismét el kell végeznie a teljes inicializálási folyamatot, ami jelentős időt vehet igénybe.
Az árnyékmotor-helyreállítás működése
Az árnyékmotor-helyreállítás a persistent GPU-memória, egy előre felmelegített készenléti motor és a worker-szintű koordináció kombinációja. A GPU Memory Service (GMS) a motorfolyamattól függetlenül kezeli a memóriaterületeket, például a súlyokat. Ennek eredményeként egy új motor ugyanazon a GPU-n csatlakozhat a meglévő memóriához. Ha az aktív folyamat meghibásodik, az árnyékmotor másodperceken belül átveszi az irányítást, miközben az újraindítás a háttérben, a kiszolgálási útvonalon kívül történik.
A tesztek során egy két motoros GLM-5.2 telepítés egyik workerét szándékosan leállították. Az árnyékmotor-helyreállítás nélkül a fennmaradó workernek kellett kezelnie az összes forgalmat a 283 másodperces hideg újraindítás alatt, ami növelte a TTFT-t és csökkentette a felhasználónkénti dekódolási sebességet. Az árnyékmotor-helyreállítással egy második worker 7,3 másodperc alatt állt újra szolgálatba, ami közel 39-szeres gyorsulást jelentett, minimalizálva a szolgáltatás minőségének zavarát.
A GMS a CUDA Virtual Memory Management API-ra épül, amely lehetővé teszi a fizikai GPU-memória és a hozzá kapcsolódó virtuális címek élettartamának független kezelését. Ez azt jelenti, hogy a súlyok akkor is megmaradnak a memóriában, ha a motorfolyamat leáll, így egy új motor azonnal hozzáférhet hozzájuk.
A GMS integrálása az inference keretrendszerekbe viszonylag egyszerű. A vLLM, SGLang és az NVIDIA TensorRT-LLM egyéni torch.cuda.CUDAPluggableAllocator segítségével integrálja a GMS-t. A GMS jelenleg előzetes verzióban érhető el, és aktívan fejlesztik a KV-gyorsítótár támogatását is.