Gyorsabb CPU-s kódolvasást ígér a LiquidAI új, 8192 tokenes modellje
A LiquidAI két új, nyílt súlyú encoder modellt adott ki, az LFM2.5-Encoder-230M és az LFM2.5-Encoder-350M. Ezek a modellek a gyártó szerint nagyobb társaik minőségét hozzák, miközben CPU-n akár 3,7-szer gyorsabbak.

A modellek 8192 tokenes kontextust támogatnak, és a bemenet hosszának növekedésével csak lassan nő a késleltetésük. A LiquidAI blogbejegyzése szerint a fejlesztők ezekkel a modellekkel dokumentum méretű feladatokat futtathatnak a meglévő hardverükön, akár csak CPU-n is.
Általános célú encoder
Az LFM2.5-Encoder modellek az LFM2.5-Retrievers családjából származnak, de szélesebb körű felhasználást céloznak. A modelleket maszkolt nyelvi célokkal tanították be, így alkalmasak osztályozásra, token-szintű feladatokra és keresésre is. Az encoder modellek számos modern, termelésben használt NLP-alkalmazás alapját képezik, mint például osztályozók, szándékfelismerők és biztonsági szűrők. Ezek a feladatok gyakran egész nap futnak, általában CPU-n, egyre hosszabb bemenetekkel. A LiquidAI szerint az LFM2.5-Encoderek a BERT és a ModernBERT által lefektetett alapokon lépnek tovább, miközben a költségek lassan nőnek a bemenet hosszának növekedésével.
Kapcsolódó: az ART-rendszer előnyei
Hogyan készültek az encoderek
Az encoderek az LFM2 decoder hátgerincéből indultak ki. A fejlesztők minden kauzális decodert kétirányú encoderré alakítottak néhány változtatással: kétirányú figyelmi maszkot alkalmaztak, nem-kauzális rövid konvolúciókat használtak, és a tokenek 30%-át maszkolták a betanítás során. A modelleket két szakaszban tanították: először általános nyelvi kompetenciát szereztek egy nagy webes korpuszon, majd 1024 tokenes kontextusról 8192 tokenesre bővítették a kontextust, erősítve a ténybeli, jogi és többnyelvű képességeket.
Kapcsolódó: a Diffusion LLM-ek gyorsítása
Eredmények és sebességtesztek
A LiquidAI 14 modellt értékelt 17 feladaton, beleértve a GLUE, SuperGLUE és többnyelvű osztályozási feladatokat. A LFM2.5-Encoder-350M a negyedik helyen végzett, míg a nála nagyobb, 3,5 milliárd paraméteres modell csaknem tízszer nagyobb volt. A LFM2.5-Encoder-230M megelőzte a ModernBERT-base-t és az összes EuroBERT modellt, miközben kisebb volt azoknál. CPU-n az LFM2.5-Encoder-230M a leggyorsabb minden szekvenciahosszon. 8192 tokenes kontextusnál a ModernBERT-base több mint másfél percet vesz igénybe egy előreterjesztéshez, míg az LFM2.5-Encoder-230M körülbelül 28 másodpercet. Ez mintegy 3,7-szeres gyorsulást jelent. GPU-n hasonló tendencia figyelhető meg, de kisebb különbséggel.
Kapcsolódó: az inference-idő skálázás
Demók és használat
A LiquidAI bemutatókat hozott létre finomhangolt LFM2.5-Encoder modellekkel, amelyek kizárólag CPU-n futnak Hugging Face space-ekben. Ezek közé tartozik a zero-shot prompt útválasztás, zero-shot szabályellenőrzés, helyesírás-javítás és 40 féle személyes adat (PII) észlelése 16 nyelven. A modellek különösen alkalmasak nagy volumenű, folyamatosan futó, olcsó és gyors feladatokra, mint az osztályozás, útválasztás vagy kivonatolás. A 350M-os verziót akkor érdemes választani, ha a pontosság a legfontosabb, míg a 230M-os verzió szűkebb hardverkörnyezetben vagy nagyobb átviteli sebesség esetén ajánlott.
Kapcsolódó: a Liquid AI új modelljei
A modellek a Hugging Face-en érhetők el, és a transformers könyvtárral könnyen betölthetők és finomhangolhatók. A LiquidAI egy finomhangolási útmutatót is biztosít, amely hosszú jogi dokumentumok feldolgozására fókuszál 8k kontextussal.
Kapcsolódó: az LKV rendszer hatékonysága