ÉlőUtoljára: 5 perceMa: 1
Modellek & LLMfrissítve: 22:16

Akar 3,2-szeres sebességet ígér a LFM2.5-DSpark az LLM-ek futtatásához

A LiquidAI új DSpark draft modelljei a LFM2.5 család három tagjához érkező spekulatív dekódolási megoldás, amely a funkcióhívások késleltetését 57%-kal csökkenti.

Akar 3,2-szeres sebességet ígér a LFM2.5-DSpark az LLM-ek futtatásához
Fotó: A Chosen Soul / Unsplash
forrás: Hugging Face·AI Forradalom szerk.·
Megosztás

A LiquidAI bemutatta DSpark draft modelljeit a LFM2.5 család három tagjához: LFM2.5-1.2B-Instruct, LFM2.5-2.6B és LFM2.5-8B-A1B. Ezek a modellek egy spekulatív dekódolási utat adnak hozzá, amely minimális memóriabővítés árán jelentős sebességnövekedést eredményez a kimeneti minőség megváltoztatása nélkül.

A DSpark akár 3,18-szoros átbocsátást biztosít GPU-n és 2,87-szereset helyi eszközökön. A LFM2.5-2.6B modell esetében a funkcióhívások késleltetése átlagosan 57%-kal csökken, ami az on-device agentic inference felé mutat. A modellekhez azonnali támogatást kapott a llama.cpp és a SGLang.

Hogyan működik a DSpark?

Az LLM-inferencia dekódolási fázisa hagyományosan memória-intenzív. A legtöbb késleltetés a DRAM-ból az SRAM-ba történő súlyok streameléséből adódik, nem pedig az intenzív számításból. A spekulatív dekódolás ezt úgy oldja meg, hogy egy könnyűsúlyú draft modellt használ jelölt tokenek előállítására, majd a célmodell ezeket egyetlen előre passzban ellenőrzi, megosztva a súlyok betöltésének költségét az ellenőrzött tokenek között.

A DSpark három komponensből áll: egy párhuzamos DFlash-stílusú gerincből, amely a célmodell kontextusfunkcióihoz van kondicionálva; egy könnyűsúlyú szekvenciális fejből, amely Markov-láncként modellezi az inter-token függőséget; és egy bizalomütemezett ellenőrzőből, amely minden token túlélési valószínűségét jósolja meg.

Képzés és architektúra

A LiquidAI a DSpark receptet követi egy nagyobb és változatosabb adatkeverékkel, amely SFT, chat, kód és funkcióhívási adatokat fed le. A draft modellek egyszerűsített, figyelmialapú, 5 rétegű és 9 blokkos architektúrával rendelkeznek. Az eredményül kapott draft modellek viszonylag kicsik, mindegyik körülbelül 300 millió paraméterrel rendelkezik.

Sebességnövekedés CPU-n és GPU-n

A LFM2.5-hez készült DSpark draft modellek azonnali támogatást élveznek a llama.cpp és a SGLang rendszerekben. A tesztek szerint a LFM2.5-2.6B modell esetében a sebességnövekedés különösen észrevehető az M4 Max MacBook Pro-n, ahol az interaktivitási szint jelentősen meghaladja a legtöbb saját felhőmodell által kínált sebességet (körülbelül 140 tok/s). A LFM2.5-8B-A1B modell esetében az on-device sebességnövekedés átlagosan csak 18%, ami a llama.cpp Metal backendjében található MoE implementációból és a több szakértőt aktiváló ellenőrzési folyamatból adódik.

Használat és elérhetőség

A DSpark draft modellek Hugging Face-en érhetők el Safetensors és GGUF formátumban. A SGLang használatához egy DSpark támogatással rendelkező build szükséges (PR #31041), míg a llama.cpp használatához a megfelelő build (PR#27383) szükséges. A LiquidAI izgatottan várja, milyen újításokat hoznak létre a fejlesztők a DSpark modellekkel.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom