LFM2.5-VL-3B-DSpark akár 3,13-szorosra gyorsítja a dekódolást Apple M5 Max-on
A Liquid AI által bemutatott LFM2.5-VL-3B-DSpark modell 3,13-szorosra gyorsítja a token-generálást Apple M5 Max processzoron, miközben a kimenet változatlan marad, és a drafter 8,9 %-kal növeli a paraméterek számát.

A 279,5 M-paraméteres drafter 8,9 %-os bővítést jelent a LFM2.5-VL-3B alapmodellhez, így a teljes paraméterszám közel 300 M-ra nő. A drafter négy rétegű, attention-only felépítésű, blokkmérete 8 vagy 9, a hardvertől függően. — írja a MarkTechPost.
Speculatív dekódolás működése
A speculatív dekódolás egy kisebb drafterrel előre jósol több token-csoportot, majd a nagy célmodell egy lépésben ellenőrzi a blokkot és csak a jóváhagyott tokeneket tartja meg. A drafter a célmodell rejtett állapotait több rétegből olvassa, így a bemenet (szöveg vagy kép) egyszerűen tenzorokként jelenik meg, ami lehetővé teszi, hogy ugyanazt az algoritmust használják a látás-nyelv modellhez.
Teljesítmény és sebességnyereség
A Liquid AI csapata szerint a modell 3,13-szorosra gyorsítja a dekódolást Apple M5 Max-on (COCO captioning teszt) és 2,66-szorosra NVIDIA H100-on, miközben az end-to-end sebességnyereség 2,62-szoros és 2,04-szoros a megfelelő feladatoknál. A gyorsulás főként a dekódolási szakaszra korlátozódik; a képkódolás és a prefill időtartama változatlan marad.
Kimeneti minőség és hőmérséklet
Greedy mintavételezés esetén a drafter által javasolt tokenek mindegyikét a célmodell elfogadja, így a kimenet azonos a bázismodellével. Nem-nulla hőmérsékletű mintavételezésnél a token-eloszlás megmarad, de a magasabb hőmérséklet csökkenti a drafter-célmodell egyezést, ezáltal lassabbá teszi a folyamatot.
Elérhetőség és licencfeltételek
A súlyok nyilvánosan letölthetők a Hugging Face-en Safetensors és GGUF formátumban, nap-első támogatással a SGLang, MLX-VLM és llama.cpp keretrendszerekben. A kiadás LFM Open License v1.0 alatt kerül ki, amely ingyenes kereskedelmi felhasználást enged csak azoknak a vállalatoknak, amelyek éves bevétele kevesebb, mint 10 millió dollár.
Használati útmutató és korlátok
SGLang-hoz v0.5.19 vagy újabb verzió szükséges, MLX-VLM-hez v0.7.2 vagy újabb, és a DSpark jelenleg csak greedy mintavételezést támogat, ezért a hőmérsékletet 0-ra kell állítani. A kvantált modellek gyorsítását a kiadás nem fedi le.
A licenc 10 millió dolláros éves bevételi határt szab, ami befolyásolhatja a modell széleskörű kereskedelmi elterjedését.