ÉlőUtoljára: 1 órájaMa: 17
Modellek & LLMfrissítve: 10:10

MoonMath AI új gyorsítókörrel verte az AMD saját figyelmi-magját MI300X-en

A MoonMath AI által fejlesztett, MIT-licenc alatt kiadott HIP figyelmi-mag 1,26-szoros sebességnövekedést kínál az AMD MI300X GPU-n, felülmúlva az AITER v3-at minden tesztelt formátumban.

MoonMath AI új gyorsítókörrel verte az AMD saját figyelmi-magját MI300X-en
Fotó: Jakub Żerdzicki / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A MoonMath AI egy új, nyílt forráskódú HIP figyelmi-magot adott ki az AMD MI300X GPU-khoz. A fejlesztők MIT-licenc alatt használhatják a kódot, amely minden tesztelt alakzatban és kerekítési módban gyorsabbnak bizonyult az AMD saját AITER v3 magjánál. A sebességnövekedés átlagosan 1,18-szoros, de elérheti a 1,26-szorost is. (MarkTechPost)

A mag a transformer modellekben kulcsfontosságú figyelmi műveletet (softmax(QKᵀ/√d)·V) végzi bf16 precizitáson. A MI300X CDNA3 architektúrájára optimalizálták, és a „one-instruction asm wrappers” technikát használja, amely lehetővé teszi az opcode kiválasztását, miközben a fordító kezeli a regisztereket. Ez a megközelítés jelentős sebbesség-növekedést eredményezett a memóriaelhelyezés optimalizálásával: a K bemenet a LDS-ben, a V a L1 gyorsítótárban, a Q és az akkumulátorok pedig regiszterekben helyezkednek el.

Kapcsolódó: Moonshot AI FlashKDA gyorsulás

Optimalizálási részletek és memóriakezelés

A MoonMath AI közlése szerint a mag numerikailag megegyezik az AITER v3 viselkedésével, beleértve a NaN és Inf kezelést, valamint a determinisztikus kimenetet. Egy valós SGLang PR-ban a mag használatával a Wan2.1 videó diffúziós modell betanítási sebessége 1,23-szorosára nőtt minőségromlás nélkül.

Kapcsolódó: FlashQLA gyorsítás Hopper-en

A kernel telepítése egyszerű, pip segítségével végezhető el, és egy kis API-t biztosít. A mag az indítópályán (stream) fut, így könnyen integrálható nagyobb feldolgozási folyamatokba. A BSHD elrendezés közvetlenül alkalmas diffúziós tenzorokhoz, és a cross-attention bármilyen KV hosszal működik.

Kapcsolódó: NVIDIA Star Elastic változatok

Tesztelés és teljesítményösszehasonlítás

A tesztek MI300X-en, bf16 precizitással és 128-as fejmérettel zajlottak. A MoonMath AI magja átlagosan 1,18-szoros (RTNE), 1,15-szörös (RTNA) és 1,08-szoros (RTZ) gyorsulást ért el az AITER-hez képest. A moduláris MAX-hoz képest az átlagos sebességnövekedés 1,44-szerestől 1,49-szeresig terjedt.

Kapcsolódó: OpenAI és Mistral új modellek

A fejlesztők egy nyolchullámú (eight-wave) folyamat-t alkalmaztak két csoportban, két barrierrel, hogy maximalizálják a mátrixmag kihasználtságát. Ez a megközelítés, hasonlóan a FlashAttention-3-hoz, biztosítja, hogy a feldolgozó egység folyamatosan dolgozzon, minimalizálva az üresjáratokat.

Kapcsolódó: Perplexity tokenizálási sebesség

A MoonMath AI által kiadott figyelmi-mag elérhető a GitHubon, és a fejlesztők már használhatják az AMD MI300X GPU-kon a transformer modellek sebességének növelésére.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom