Az inferencia sebességét lassítja a hosszú kontextus – közölte az NVIDIA
Az AI-modellek figyelmi költsége 4K kontextusnál 18%-ról 128K-nál 85%-ra nőhet, ami drasztikusan befolyásolja az inferencia sebességét — közölte az NVIDIA.

A kutatók szerint a modellarchitektúra és a hardver összehangolása kulcsfontosságú a teljesítmény maximalizálásához. (Nvidia Developer)
Prefill és Decode: Két Különböző Probléma
Az inferencia két fő fázisa, a prefill és a decode eltérő kihívásokat rejt. A prefill a teljes utasítást párhuzamosan dolgozza fel, és számításigényes (compute-bound). Ezzel szemben a decode fázis, amely tokenenként generál, memóriakorlátos (memory-bound) a KV-gyorsítótár olvasása miatt. Az NVIDIA elemzése szerint a prefill fázist a szekvenciahossz (ISL) dominálja, míg a decode hatékonyságát a csoportméret ($G$) növelése javítja.
Csoportméret és Fejméret Optimalizálása
Az optimális teljesítmény érdekében az NVIDIA javasolja, hogy a decode fázisban magas csoportméretet ($G$) használjanak. A fejméretet (head dimension) 128 vagy 256 értékre érdemes állítani, hogy illeszkedjen a GPU csempéjéhez és a memóriához. A KV-gyorsítótár méretének minimalizálása cache-kompresszióval, spars vagy sliding-window attention technikákkal, illetve hibrid architektúrákkal, mint az NVIDIA Nemotron 3, tovább növeli a hatékonyságot.
Párhuzamossági Stratégiák GPU-kon
A párhuzamossági stratégiákat a KV-fejek számához kell igazítani. A Tensor Parallelism (TP) nem haladhatja meg a KV-fejek számát (KH), hogy elkerülhető legyen a KV-duplikáció. Kevés KV-fejjel rendelkező modellek esetén Attention Data Parallelism (ADP), KV Parallelism (KVP) vagy hibrid megközelítések, mint a Wide EP vagy Helix Parallelism, javasoltak. Ezeket a technikákat már implementálták a TensorRT-LLM-ben.
Új Irányelvek a TensorRT-LLM-ben
Az NVIDIA a TensorRT-LLM-be integrálta a javasolt optimalizálási technikákat, amelyek segítenek a modellfejlesztőknek növelni az inferencia átviteli sebességét és interaktivitását NVIDIA GPU-kon. Az elemzések becsléseken és specifikus méréseken alapulnak, és a javasolt beállítások hatékonysága függhet a konkrét hardverkonfigurációtól és a modell KV-fejek számától.