Akar 3,2-szeres sebességet ígér a LFM2.5-DSpark az LLM-ek futtatásához
A LiquidAI új DSpark draft modelljei a LFM2.5 család három tagjához érkező spekulatív dekódolási megoldás, amely a funkcióhívások késleltetését 57%-kal csökkenti.

A LiquidAI bemutatta DSpark draft modelljeit a LFM2.5 család három tagjához: LFM2.5-1.2B-Instruct, LFM2.5-2.6B és LFM2.5-8B-A1B. Ezek a modellek egy spekulatív dekódolási utat adnak hozzá, amely minimális memóriabővítés árán jelentős sebességnövekedést eredményez a kimeneti minőség megváltoztatása nélkül.
A DSpark akár 3,18-szoros átbocsátást biztosít GPU-n és 2,87-szereset helyi eszközökön. A LFM2.5-2.6B modell esetében a funkcióhívások késleltetése átlagosan 57%-kal csökken, ami az on-device agentic inference felé mutat. A modellekhez azonnali támogatást kapott a llama.cpp és a SGLang.
Hogyan működik a DSpark?
Az LLM-inferencia dekódolási fázisa hagyományosan memória-intenzív. A legtöbb késleltetés a DRAM-ból az SRAM-ba történő súlyok streameléséből adódik, nem pedig az intenzív számításból. A spekulatív dekódolás ezt úgy oldja meg, hogy egy könnyűsúlyú draft modellt használ jelölt tokenek előállítására, majd a célmodell ezeket egyetlen előre passzban ellenőrzi, megosztva a súlyok betöltésének költségét az ellenőrzött tokenek között.
A DSpark három komponensből áll: egy párhuzamos DFlash-stílusú gerincből, amely a célmodell kontextusfunkcióihoz van kondicionálva; egy könnyűsúlyú szekvenciális fejből, amely Markov-láncként modellezi az inter-token függőséget; és egy bizalomütemezett ellenőrzőből, amely minden token túlélési valószínűségét jósolja meg.
Képzés és architektúra
A LiquidAI a DSpark receptet követi egy nagyobb és változatosabb adatkeverékkel, amely SFT, chat, kód és funkcióhívási adatokat fed le. A draft modellek egyszerűsített, figyelmialapú, 5 rétegű és 9 blokkos architektúrával rendelkeznek. Az eredményül kapott draft modellek viszonylag kicsik, mindegyik körülbelül 300 millió paraméterrel rendelkezik.
Sebességnövekedés CPU-n és GPU-n
A LFM2.5-hez készült DSpark draft modellek azonnali támogatást élveznek a llama.cpp és a SGLang rendszerekben. A tesztek szerint a LFM2.5-2.6B modell esetében a sebességnövekedés különösen észrevehető az M4 Max MacBook Pro-n, ahol az interaktivitási szint jelentősen meghaladja a legtöbb saját felhőmodell által kínált sebességet (körülbelül 140 tok/s). A LFM2.5-8B-A1B modell esetében az on-device sebességnövekedés átlagosan csak 18%, ami a llama.cpp Metal backendjében található MoE implementációból és a több szakértőt aktiváló ellenőrzési folyamatból adódik.
Használat és elérhetőség
A DSpark draft modellek Hugging Face-en érhetők el Safetensors és GGUF formátumban. A SGLang használatához egy DSpark támogatással rendelkező build szükséges (PR #31041), míg a llama.cpp használatához a megfelelő build (PR#27383) szükséges. A LiquidAI izgatottan várja, milyen újításokat hoznak létre a fejlesztők a DSpark modellekkel.