ÉlőUtoljára: 4 perceMa: 12
Modellek & LLMfrissítve: 09:16

Kétszer gyorsabb a ColModernVBERT-nél a Hugging Face új NeoMME modellje

Az új NeoMME encoder család egyetlen, bidirekcionális Transformerrel dolgozza fel a szöveges tokeneket és a képfoltokat, leváltva a különálló vision towert és nyelvi modellt.

Kétszer gyorsabb a ColModernVBERT-nél a Hugging Face új NeoMME modellje
Fotó: Shubham Dhage / Unsplash
forrás: Hugging Face·AI Forradalom szerk.·
Megosztás

A Hugging Face Blogon bemutatott NeoMME egy újfajta, egységes Transformer-architektúrát használ a szöveges és képi adatok feldolgozására. A 260 millió és 800 millió paraméteres modellek nem építenek előre betanított vision towerre vagy kauzális nyelvi modellre, hanem egyetlen Transformer-mag dolgozza fel mindkét modalitást.

A NeoMME-t a NeoMME-Retriever finomhangolásával vizuális dokumentum-visszakeresésre optimalizálták. A modell másodpercenként mintegy 51 oldalt képes feldolgozni 2048×2048-as felbontásban egy NVIDIA L40S GPU-n, ami nagyjából kétszer gyorsabb a ColModernVBERT sebességénél — állítja a Hugging Face Blog.

Hatékonyabb adattárolás és visszakeresés

A fejlesztők hierarchikus tokengyűjtést és aszimmetrikus kvantálást alkalmaztak, ami 255-szörösére csökkenti a késői interakciós index tárolási igényét, nagyjából 1,5 MB-ról 6 kB-ra oldalanként. Ez a csökkentés úgy érhető el, hogy közben az nDCG@10 mutató >95%-a megmarad.

A NeoMME mindkét mérete, a 260M és a 800M, a ViDoRe v3 Pareto-határán helyezkedik el az nDCG@10 és a modellméret tekintetében. A modellek akár 16 384 tokent is képesek kezelni, ami körülbelül két 4K UHD képnek felel meg, és olyan modern encoder-fejlesztéseket használnak, mint a grouped-query attention és a 2D rotary position embeddings.

Multilingvális és multimodalitás

A NeoMME egy bidirekcionális Transformer-t használ, amely egyszerre dolgozza fel a szöveges tokeneket és a képfoltokat. A modell betanítása során a szerzők egy új BPE tokenezert hoztak létre 131 ezer tokenes szókincscsel, többnyelvű szövegekre, kódokra, matematikai kifejezésekre és gépi kép-átiratokra alapozva. A pretrainelési folyamat során a modell masked discrete-diffusion célfüggvénnyel tanul, miközben a szöveges tokenek akár 100%-os elfedése is előfordulhat, ami arra kényszeríti a modellt, hogy a látható képi információkra támaszkodjon.

A NeoMME modelljei Apache 2.0 licenc alatt érhetők el a Hugging Face Transformers könyvtárában.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom