ÉlőUtoljára: az iméntMa: 28
Hardver & Infrafrissítve: 22:16

Az NVIDIA Transformer Engine 10-szer gyorsabbá teszi a MoE tréninget JAX-ban

Az NVIDIA Transformer Engine és a JAX 10.4-szeres sebességnövekedést ért el a Mixture of Experts (MoE) tréningben NVIDIA GB200-on, a DeepSeek-V3 modell teljesítménye 103-ról 1068 TFLOPS/GPU-ra emelkedett.

Az NVIDIA Transformer Engine 10-szer gyorsabbá teszi a MoE tréninget JAX-ban
Fotó: Anne Nygård / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

Technikai optimalizálások

A szakértői párhuzamosságot (expert parallelism) az NCCL EP gyorsítja, amely egyesíti az elküldési és összesítő szakaszokat, valamint deduplikálja a tokeneket a hálózati forgalom csökkentése érdekében. További optimalizálások, mint a JAX host offloading és az XLA multistreaming, csökkentik a memória-szűk keresztmetszeteket és átfedik a kommunikációt. (Nvidia Developer)

A Dropless MoE minden tokent feldolgoz, megőrzi a modell minőségét, szemben a kapacitásalapú MoE-val, amely tokeneket dob vagy kitölt. A Transformer Engine új, csoport-aware MXFP8 kvantálást és optimalizált EP műveleteket kínál az elküldéshez és összesítéshez.

Skálázhatóság és elérhetőség

A DeepSeek-V3 671B modell tréningje során az optimalizált rendszer 1024 GPU-n 97%-os skálázási hatékonyságot tart fenn NVIDIA GB300 NVL72 hardveren.

Az optimalizált JAX MoE útvonal reprodukálásához próbálja ki az NVIDIA NGC MaxText konténert Transformer Engine-nel. A részletes beállításokért tekintse meg a MaxText MoE Configuration útmutatót, a könyvtár képességeinek megértéséhez pedig a Transformer Engine dokumentációját.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom