ÉlőUtoljára: 7 perceMa: 27
Modellek & LLMfrissítve: 22:17

Csak 3 milliárd paramétert aktivál az NVIDIA Nemotron 3.5 Lightning

Az NVIDIA Nemotron 3.5 Lightning modellje 30 milliárd paraméteréből tokenenként mindössze 3 milliárdot használ, ami a Mixture-of-Experts (MoE) architektúrának köszönhető.

Csak 3 milliárd paramétert aktivál az NVIDIA Nemotron 3.5 Lightning
Fotó: Growtika / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

A Mixture-of-Experts (MoE) architektúra lehetővé teszi, hogy a modellek kevesebb számítási kapacitást használjanak fel tokenenként, miközben az összes szakértő (expert) betöltődik a GPU memóriájába. Ez a megközelítés leválasztja a memória- és a számítási költségeket, ellentétben a hagyományos, sűrű (dense) modellekkel, ahol mindkettő együtt skálázódik. (Nvidia Developer)

A sűrű modellek minden egyes paraméterüket aktiválják minden token feldolgozásakor. Ezzel szemben az MoE modellek több, speciális „szakértő” hálózatot tárolnak, de minden tokent csak egy kiválasztott részhalmazon keresztül futtatnak. Ez a struktúra, ahol minden dekóderrétegben több szakértő (például 8, 64 vagy 128) található, egy tanult router (kapuhálózat) segítségével történik, amely minden tokent a legmagasabb pontszámot kapott szakértőkhöz irányít. A Nemotron 3.5 Lightning például egy Mamba-2 + MoE + Attention hibrid architektúrát használ.

Teljesítmény és sebesség: MoE előnyök és kihívások

Az MoE modellek gyakran gyorsabbak token-throughput tekintetében, mivel tokenenként csak a feed-forward paraméterek egy részét aktiválják. A sűrű modellek bár az egész hálózatot aktiválják, egyszerűbb kiszolgálást és kiszámíthatóbb késleltetést kínálhatnak. Azonban magas párhuzamosság esetén az MoE modellek előnye csökkenhet a routing és a memória-mozgatás miatt. Az NVIDIA szerint a Nemotron 3.5 Lightning, amely Mamba-2 rétegeket és spekulatív dekódolást is használ, jobb token-throughputot ér el, mint a hasonló méretű sűrű modellek, mint például a Gemma 4 31B.

Mikor válasszunk MoE modellt?

A választás a bevetési korlátoktól függ. Az MoE modellek leválasztják a memóriát (teljes paraméterek → VRAM) a számítástól (aktív paraméterek → FLOPs per token). Ez azt jelenti, hogy a teljes memória költségét előre ki kell fizetni, míg a számítási költség csak az aktivált szakértőkkel skálázódik.

Bár az MoE modellek általában jobb throughputot biztosítanak, a késleltetési előnyük magas párhuzamosság esetén szűkülhet. A finomhangolásnál figyelni kell a router egyensúlyának megtartására, és a kvantálás is eltérően befolyásolja az MoE specifikus rétegeket, mint a sűrű modellek komponenseit. Az NVIDIA javasolja a Nemotron 3.5 Lightning kipróbálását a build.nvidia.com oldalon vagy letöltését Hugging Face-ről.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom