ÉlőUtoljára: az iméntMa: 12
Modellek & LLMfrissítve: 10:15

LFM2.5-VL-3B-DSpark akár 3,13-szorosra gyorsítja a dekódolást Apple M5 Max-on

A Liquid AI által bemutatott LFM2.5-VL-3B-DSpark modell 3,13-szorosra gyorsítja a token-generálást Apple M5 Max processzoron, miközben a kimenet változatlan marad, és a drafter 8,9 %-kal növeli a paraméterek számát.

LFM2.5-VL-3B-DSpark akár 3,13-szorosra gyorsítja a dekódolást Apple M5 Max-on
Fotó: BoliviaInteligente / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A 279,5 M-paraméteres drafter 8,9 %-os bővítést jelent a LFM2.5-VL-3B alapmodellhez, így a teljes paraméterszám közel 300 M-ra nő. A drafter négy rétegű, attention-only felépítésű, blokkmérete 8 vagy 9, a hardvertől függően. — írja a MarkTechPost.

Speculatív dekódolás működése

A speculatív dekódolás egy kisebb drafterrel előre jósol több token-csoportot, majd a nagy célmodell egy lépésben ellenőrzi a blokkot és csak a jóváhagyott tokeneket tartja meg. A drafter a célmodell rejtett állapotait több rétegből olvassa, így a bemenet (szöveg vagy kép) egyszerűen tenzorokként jelenik meg, ami lehetővé teszi, hogy ugyanazt az algoritmust használják a látás-nyelv modellhez.

Teljesítmény és sebességnyereség

A Liquid AI csapata szerint a modell 3,13-szorosra gyorsítja a dekódolást Apple M5 Max-on (COCO captioning teszt) és 2,66-szorosra NVIDIA H100-on, miközben az end-to-end sebességnyereség 2,62-szoros és 2,04-szoros a megfelelő feladatoknál. A gyorsulás főként a dekódolási szakaszra korlátozódik; a képkódolás és a prefill időtartama változatlan marad.

Kimeneti minőség és hőmérséklet

Greedy mintavételezés esetén a drafter által javasolt tokenek mindegyikét a célmodell elfogadja, így a kimenet azonos a bázismodellével. Nem-nulla hőmérsékletű mintavételezésnél a token-eloszlás megmarad, de a magasabb hőmérséklet csökkenti a drafter-célmodell egyezést, ezáltal lassabbá teszi a folyamatot.

Elérhetőség és licencfeltételek

A súlyok nyilvánosan letölthetők a Hugging Face-en Safetensors és GGUF formátumban, nap-első támogatással a SGLang, MLX-VLM és llama.cpp keretrendszerekben. A kiadás LFM Open License v1.0 alatt kerül ki, amely ingyenes kereskedelmi felhasználást enged csak azoknak a vállalatoknak, amelyek éves bevétele kevesebb, mint 10 millió dollár.

Használati útmutató és korlátok

SGLang-hoz v0.5.19 vagy újabb verzió szükséges, MLX-VLM-hez v0.7.2 vagy újabb, és a DSpark jelenleg csak greedy mintavételezést támogat, ezért a hőmérsékletet 0-ra kell állítani. A kvantált modellek gyorsítását a kiadás nem fedi le.

A licenc 10 millió dolláros éves bevételi határt szab, ami befolyásolhatja a modell széleskörű kereskedelmi elterjedését.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom