ÉlőUtoljára: 1 órájaMa: 6
Hardver & Infrafrissítve: 03:17

Tizenhat szoros gyorsulást ért el a Cua az Apple Silicon VM-ekben

Egy új kompatibilitási réteg lehetővé teszi a modernebb Metal-kernelek használatát, így az LLM-következtetés akár 16-szor gyorsabb lehet Apple Silicon VM-ekben, megközelítve a natív sebességet.

Tizenhat szoros gyorsulást ért el a Cua az Apple Silicon VM-ekben
Fotó: Nana Dua / Unsplash
forrás: Hacker News·AI Forradalom szerk.·
Megosztás

Egy új, folyamatspecifikus kompatibilitási réteg drámaian felgyorsítja a nagy nyelvi modellek (LLM) futtatását virtuális macOS környezetekben. A Cua által kifejlesztett megoldás lehetővé teszi a modernebb Metal-kernelek kiválasztását, ami akár 16-szoros sebességnövekedést eredményezhet a hagyományos virtuális gépekhez képest. (Hacker News)

A fejlesztők a „Lume” nevű macOS virtualizációs verem alapjaira építkezve hozták létre a réteget. Ez a megoldás módosítja a virtuális GPU által jelentett Metal képességeket, így a llama.cpp például gyorsabb kódutakat választhat. A TinyLlama 1.1B modell esetében ez 11,08-szoros prompt-feldolgozási és 16,36-szoros token-generálási sebességet jelentett egy M1 Ultra chipen futtatott virtuális gépen. A sebesség megközelítette a natív, „bare-metal” teljesítmény 98%-át.

Modellek teljesítményjavulása

A kísérleteket kiterjesztették a Google Gemma 4 12B QAT Q4_0 és a Meta Muse Glimmer 30B Q4_K-M GGUF modellekkel is. A Gemma 4 esetében a prompt-feldolgozás 7,20-szorosára, a token-generálás pedig 14,54-szeresére nőtt, míg a Muse Glimmer 30B modellel a prompt-feldolgozás 7,55-szörös, a token-generálás pedig 8,87-szeres gyorsulást mértek. Ezeknél a modelleknél a virtuális gép sebessége elérte a natív teljesítmény 99,59%-át prompt-feldolgozás, illetve 94,82%-át token-generálás terén.

A technikai háttér és a megoldás

Az Apple Silicon alapú macOS virtuális gépekben a Virtualization.framework által biztosított virtuális GPU egy korlátozott Metal képességprofilt jelentett a vendég operációs rendszer számára. Ez arra kényszerítette az olyan alkalmazásokat, mint a llama.cpp, hogy lassabb, régebbi kernelt használjanak. A Cua által kifejlesztett „Metal capability shim” nevű réteg ezt a problémát orvosolja azáltal, hogy futásidőben módosítja a riportált képességeket, lehetővé téve a modernebb funkciók, például az SIMD-group matrix és a bfloat16 használatát.

A probléma nem egyedi a Cua megoldásánál. Más macOS virtualizációs eszközök, mint például a Tart, szintén hasonló GPU képességbeli korlátozásokkal küzdenek. A Tart GitHub oldalán is nyitott „No GPU passthrough in macOS guest?” („Nincs GPU passthrough macOS vendégben?”) problémát találtak a fejlesztők, ami rávilágít a macOS vendégkörnyezetekben futó LLM-ek teljesítményének általános kihívásaira.

A Cua a kutatási eredményeket és a forráskódot nyílt licenc alatt teszi elérhetővé, hogy mások is reprodukálhassák az eredményeket és segítsenek feltérképezni, mely Apple Silicon chipek, macOS verziók és Metal munkaterhelések profitálnak a leginkább a fejlesztésből. A cég a Metal capability shim technológiával teszi lehetővé a llama.cpp gyorsabb futtatását.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom