Egyetlen munkaállomás-GPU-n futtatja a 753 milliárdos GLM-5.2 modellt a FreeToken
A FreeToken nevű új rendszer lehetővé teszi a 753 milliárdos GLM-5.2 modell futtatását egyetlen munkaállomás GPU-n, 35 milliárdos modellek pedig laptopokon is futtathatók.

A nyílt forráskódú AI-modellek egyre gyorsabban fejlődnek, de futtatásukhoz továbbra is adatközpont-szintű GPU-klaszterekre van szükség. Ezen változtathat a FreeToken, amelyet az UC Berkeley és az UT Austin kutatói fejlesztettek ki. A rendszer egy személyi gépet rugalmas, egységesített futtatási platformként kezel, és folyamatosan hozzáigazítja a számításokat és a modellállapotot a rendelkezésre álló GPU-, CPU-, memória- és hálózati sávszélességhez.
Ennek eredményeként egy 35 milliárdos modell interaktív sebességgel futtatható egy 8 GB-os laptop GPU-n, egy 284 milliárdos modell egy gamer asztali számítógépen, míg a 753 milliárdos GLM-5.2 modell egyetlen munkaállomás-kártyán futtatható — közölte a MarkTechPost.
Elérhetőség és célközönség
A FreeToken Apache-2.0 licenc alatt érhető el a GitHubon, PyPI-csomagként (pip install "freetoken[accel]") telepíthető, és egy kattintással telepíthető asztali alkalmazásként is elérhető Windows és Linux rendszerekre a flashml.ai címen. A parancssori felület Linux x86_64 rendszereket céloz NVIDIA GPU-val és r580+ meghajtóval (CUDA 13). A `ft serve` parancs OpenAI- és Anthropic-kompatibilis végpontokat nyit meg az 1919-es porton, míg a `ft launch claude` pedig a Claude Code, Codex, OpenCode vagy OpenClaw modelleket köti össze a helyi géppel.
A rendszer elsősorban szóló fejlesztőknek, startupoknak és kis- és középvállalkozások mérnöki csapatainak szól, akiknek az ügynök token-költségei már meghaladják a saját GPU-juk árát. Nagyvállalatok számára légmentesen zárt vagy szabályozott munkaterheltek esetén lehet ideális, nem pedig adatközponti helyettesítésként. Legerősebb iparági illeszkedés: egészségügy és jog (az adatok soha nem hagyják el a gépet), védelem, pénzügy és szellemi tulajdonnal intenzíven foglalkozó K+F.
A Mixture-of-Experts (MoE) kihívásai és a FreeToken megoldásai
A Mixture-of-Experts (MoE) architektúrák lehetővé teszik a nagy modellek futtatását, mivel minden token feldolgozásához csak az aktív szakértők egy kis részét használják. A DeepSeek-V4-Flash például 256 szakértőből 6-ot aktivál rétegenként, így egy token feldolgozásához csak 13 milliárd paraméter vesz részt a 284 milliárdos modellben. Azonban a teljes szakértőkészlet így is jelentős, FP4 pontosságon körülbelül 140 GB tárhelyet igényel, így az inaktív szakértők a gazdagép memóriájában helyezkednek el, és igény szerint kerülnek a futtatási folyamatba.
A kutatók három fő problémát azonosítottak a meglévő rendszerekben: a prefill fázis lerombolja a modell ritkaságát, a statikus elhelyezés nem kezeli megfelelően a dekódolási forgalmat, és a fogyasztói CPU-k nem képesek lépést tartani a GPU és a PCIe sávszélességével.
A FreeToken sávszélesség-adaptív végrehajtással (q* policy) oldja meg ezeket a problémákat: a gyorsítótár-hibákat arányosan osztja el a PCIe és a gazdagép memória sávszélessége között. Emellett szemantikai szempontú gyorsítótár-kezelést és rugalmas memóriakezelést is alkalmaz, így a modellfrissítések és a GPU-gyorsítótár újjáépítése minimális leállással vagy újraindítás nélkül végezhető el.
A tesztek szerint az RTX 5090-en a FreeToken 77–83 tok/s sebességet ér el Qwen3.6-35B-A3B modellen, és 22–25 tok/s-ot a DeepSeek-V4-Flash modellen, ami 1,5–2,3-szorosa a legerősebb alapvonalaknak. Egy 8 GB-os RTX 4060 laptopon a 35 milliárdos modell 39,3 tok/s sebességgel fut, ami meghaladja a Codex átlagos sebességét. Egyetlen RTX PRO 6000 kártyán pedig a 753 milliárdos GLM-5.2 modell 14,9 tok/s sebességgel fut, szemben a llama.cpp 7,3 tok/s sebességével.