ÉlőUtoljára: az iméntMa: 12
Hardver & Infrafrissítve: 13:15

Az inferencia sebességét lassítja a hosszú kontextus – közölte az NVIDIA

Az AI-modellek figyelmi költsége 4K kontextusnál 18%-ról 128K-nál 85%-ra nőhet, ami drasztikusan befolyásolja az inferencia sebességét — közölte az NVIDIA.

Az inferencia sebességét lassítja a hosszú kontextus – közölte az NVIDIA
Fotó: BoliviaInteligente / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

A kutatók szerint a modellarchitektúra és a hardver összehangolása kulcsfontosságú a teljesítmény maximalizálásához. (Nvidia Developer)

Prefill és Decode: Két Különböző Probléma

Az inferencia két fő fázisa, a prefill és a decode eltérő kihívásokat rejt. A prefill a teljes utasítást párhuzamosan dolgozza fel, és számításigényes (compute-bound). Ezzel szemben a decode fázis, amely tokenenként generál, memóriakorlátos (memory-bound) a KV-gyorsítótár olvasása miatt. Az NVIDIA elemzése szerint a prefill fázist a szekvenciahossz (ISL) dominálja, míg a decode hatékonyságát a csoportméret ($G$) növelése javítja.

Csoportméret és Fejméret Optimalizálása

Az optimális teljesítmény érdekében az NVIDIA javasolja, hogy a decode fázisban magas csoportméretet ($G$) használjanak. A fejméretet (head dimension) 128 vagy 256 értékre érdemes állítani, hogy illeszkedjen a GPU csempéjéhez és a memóriához. A KV-gyorsítótár méretének minimalizálása cache-kompresszióval, spars vagy sliding-window attention technikákkal, illetve hibrid architektúrákkal, mint az NVIDIA Nemotron 3, tovább növeli a hatékonyságot.

Párhuzamossági Stratégiák GPU-kon

A párhuzamossági stratégiákat a KV-fejek számához kell igazítani. A Tensor Parallelism (TP) nem haladhatja meg a KV-fejek számát (KH), hogy elkerülhető legyen a KV-duplikáció. Kevés KV-fejjel rendelkező modellek esetén Attention Data Parallelism (ADP), KV Parallelism (KVP) vagy hibrid megközelítések, mint a Wide EP vagy Helix Parallelism, javasoltak. Ezeket a technikákat már implementálták a TensorRT-LLM-ben.

Új Irányelvek a TensorRT-LLM-ben

Az NVIDIA a TensorRT-LLM-be integrálta a javasolt optimalizálási technikákat, amelyek segítenek a modellfejlesztőknek növelni az inferencia átviteli sebességét és interaktivitását NVIDIA GPU-kon. Az elemzések becsléseken és specifikus méréseken alapulnak, és a javasolt beállítások hatékonysága függhet a konkrét hardverkonfigurációtól és a modell KV-fejek számától.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom