ÉlőUtoljára: 1 perceMa: 26
Hardver & Infrafrissítve: 22:17

Percek alatt dolgozza fel a szöveget az NVIDIA új AI-chipje

Az NVIDIA Groq 3 LPX és a Vera Rubin NVL72 platform 3431 kiadott tokent/másodperc sebességet ért el a 100K kontextusú Gemma 4 31B modellel, miközben megőrzi a pontosságot és a minőséget.

Percek alatt dolgozza fel a szöveget az NVIDIA új AI-chipje
Fotó: Random Thinking / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

A rendszer determinisztikus, fordító által ütemezett munkaterhelés-tervezést, finomhangolt számítási-kommunikációs átfedést és előre tervezett chip-ek közötti hálózatkezelést használ az első bit késleltetésének minimalizálására. Ez lehetővé teszi a hatékony tenzor-parallelizmust még kis kötegelt méretek esetén is, ami kritikus az ügynöki, többkörös inferenciához nagy és hosszú kontextusú modellekkel. (Nvidia Developer)

Magas interaktivitás és hosszú kontextus

Az ügynöki munkamenetek jellemzően többkörös inferenciát jelentenek. Minden kör végén az ügynök kimenete hozzáadódik a folyamatosan növekvő kontextushoz, amelyet minden későbbi körbe táplálnak. Ez a kontextus több százezer tokenre nőhet egy teljes ügynöki munkamenet során, különösen, ha a munkamenet meghaladja a száz kört. Hosszú kontextus nélkül az ügynökök csak a releváns kontextus töredékét tudják figyelembe venni, ami korlátozza az ügynöki képességeket.

A kihívás: Sebesség és hosszú kontextus kis kötegekkel

A modellek kiszolgálása több mint 3000 token/másodperc sebességgel felhasználónként, miközben egy 100K tokenes KV gyorsítótárat kezelünk, különleges rendszermérnöki kihívást jelent. Az inferenciás rendszerekben az olyan felosztási és hódítás technikák, mint a tenzor-parallelizmus (TP), nagyságrendekkel gyorsabbá tehetik a folyamatot, de ehhez hatékonyan kell kezelni a koordinációt.

A legmagasabb interaktivitási szintekhez nagyon kis kötegelt méretek szükségesek, ahol a rögzített koordinációs költség meghaladhatja a TP által megtakarított időt. A TP hatékonyságához szoros koordináció szükséges, ahol sok kis tenzor mozog a számítási egységek között.

A Groq 3 LPX megoldása

Az NVIDIA Groq 3 LPX a fordító által ütemezett munkaterhelés-tervezést használja. Ez magában foglalja a chip-ek közötti (C2C) hálózatkezelést a rack-en belül, valamint a számítások és a processzorok közötti kommunikáció erőteljes átfedését.

A Groq 3 LPX determinisztikus végrehajtási modellt használ, amely lehetővé teszi a fordító számára, hogy pontosan megtervezze a munkaterhelés futtatását, beleértve az adatáthelyezési ütemtervet is, mielőtt az elkezdődne. Ez az előzetes ütemezés lehetővé teszi az adatáthelyezések alapvető átalakítását, ahol a LPUs-ok adatokat küldhetnek az ütemtervnek megfelelően.

A SPEED-Bench teljesítményteszten a Groq 3 LPX 4767 median kiadott tokent/másodperc sebességet mutatott általános ügynöki és kódolási feladatokra. A rendszer támogatja a Vera Rubin NVL72-vel való többszörös együttműködési konfigurációkat, mint például az előzetes betöltés-dekódolás megosztása, a figyelő-FFN megosztása és a spekulatív külső-drafter dekódolás, amelyek több trillió paraméteres modellekig skálázhatók. A technológia kulcsfontosságú a 2T+ paraméteres modellekkel működő többügynökös rendszerek kiszolgálásához nagy interaktivitással és hosszú kontextussal.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom