Ötszörös gyorsulást ígér multimodális modelleknek az NVIDIA Dynamo
Az NVIDIA Dynamo új EPD-diszaggregációs technikája akár ötször gyorsabb első tokenig tartó válaszidőt (TTFT) és hétszer gyorsabb végpontok közötti válaszidőt ígér multimodális modellek esetén.

Az NVIDIA Dynamo új, encode-prefill-decode (EPD) diszaggregációs technikája elkülöníti a látóencóder (vision encoder) és az LLM prefill/decode szakaszok feladatait, ami jelentős gyorsulást eredményezhet a multimodális AI-modellek kiszolgálásában. A technika különösen hatékony képekkel nehezített utasítások, rövid- vagy közepes hosszúságú kimenetek és kvantált Mixture-of-Experts (MoE) modellek esetén. (Nvidia Developer)
Az EPD-diszaggregáció lényege, hogy a multimodalitás feldolgozását több, függetlenül skálázható szakaszra bontja. Ezáltal a látóencóder feladatai, amelyek a média feldolgozását és a transformer (ViT) futtatását foglalják magukban, elkülönülnek az LLM prefill és decode fázisaitól. Az NVIDIA belső tesztjei szerint ez akár 5x gyorsabb TTFT-t és 7x gyorsabb végpontok közötti válaszidőt eredményezhet.
Három elhelyezési topológia
A Dynamo háromféle encoder elhelyezési topológiát támogat: aggregált kiszolgálás, ahol minden feladat egy GPU-n fut; kolokált encoder, ahol az encóder és a prefill-decode (PD) munkások ugyanazon a GPU-n osztoznak; valamint diszaggregált encoder, ahol az encóder külön, alacsonyabb költségű GPU-tieren fut, és az NVIDIA Inference Transfer Library (NIXL) segítségével kommunikál a fő GPU-kkal.
A kolokált encoder megoldás általában jobb választás homogén klaszterek esetén, mivel a látóencóder viszonylag könnyű feladat, így nem érdemes egy egész GPU-t csak neki szentelni. A diszaggregált encoder akkor válik vonzóvá, ha rendelkezésre áll egy olcsóbb GPU-tier, amely jobban megfelel az encóder munkájának, míg a fő GPU-k a számítás- és memóriaigényesebb LLM feladatokra koncentrálhatnak. Az NVIDIA RTX 6000D GPU-kat használta encóderként, míg a GB200 GPU-kat a PD munkásoknak.
Ahol az EPD igazán számít
Az EPD előnyei nagymértékben függnek a munka megosztásától a látóencóder, az LLM prefill és a decode között. A technika akkor a leghasznosabb, ha a látóencóder jelentős mértékben hozzájárul a kérés feldolgozási idejéhez, vagy korlátozza a rendszerteljesítményt. Különösen igaz ez média-intenzív kérések esetén, de az eredményt befolyásolja a kimeneti hossz, a modell mérete és pontossága, valamint a forgalom keveredése is.
Vegyes forgalomban, ahol szöveges és multimodális kérések is vannak, az EPD csökkenti a szöveges kérések átlagos TTFT-jét 42,2%-kal, a képekkel kapcsolatos kérésekét pedig 30,8%-kal azáltal, hogy megszünteti a head-of-line blockingot. Az LLM súlyainak NVFP4-re kvantálása, miközben a látóencóder BF16 pontosságot használ, a kolokált EPD jó átviteli sebességét 1,78-szorosról 2,64-szeresre növeli az aggregált kiszolgáláshoz képest.
A Dynamo az ai-dynamo/dynamo GitHub útmutató követésével reprodukálhatóak az EPD-diszaggregációs kísérletek. Az NVIDIA javasolja a párhuzamos média dekódolás engedélyezését, valamint az embedding cache használatát az ismétlődő média tartalom esetén.