Kétszer gyorsabb a ColModernVBERT-nél a Hugging Face új NeoMME modellje
Az új NeoMME encoder család egyetlen, bidirekcionális Transformerrel dolgozza fel a szöveges tokeneket és a képfoltokat, leváltva a különálló vision towert és nyelvi modellt.

A Hugging Face Blogon bemutatott NeoMME egy újfajta, egységes Transformer-architektúrát használ a szöveges és képi adatok feldolgozására. A 260 millió és 800 millió paraméteres modellek nem építenek előre betanított vision towerre vagy kauzális nyelvi modellre, hanem egyetlen Transformer-mag dolgozza fel mindkét modalitást.
A NeoMME-t a NeoMME-Retriever finomhangolásával vizuális dokumentum-visszakeresésre optimalizálták. A modell másodpercenként mintegy 51 oldalt képes feldolgozni 2048×2048-as felbontásban egy NVIDIA L40S GPU-n, ami nagyjából kétszer gyorsabb a ColModernVBERT sebességénél — állítja a Hugging Face Blog.
Hatékonyabb adattárolás és visszakeresés
A fejlesztők hierarchikus tokengyűjtést és aszimmetrikus kvantálást alkalmaztak, ami 255-szörösére csökkenti a késői interakciós index tárolási igényét, nagyjából 1,5 MB-ról 6 kB-ra oldalanként. Ez a csökkentés úgy érhető el, hogy közben az nDCG@10 mutató >95%-a megmarad.
A NeoMME mindkét mérete, a 260M és a 800M, a ViDoRe v3 Pareto-határán helyezkedik el az nDCG@10 és a modellméret tekintetében. A modellek akár 16 384 tokent is képesek kezelni, ami körülbelül két 4K UHD képnek felel meg, és olyan modern encoder-fejlesztéseket használnak, mint a grouped-query attention és a 2D rotary position embeddings.
Multilingvális és multimodalitás
A NeoMME egy bidirekcionális Transformer-t használ, amely egyszerre dolgozza fel a szöveges tokeneket és a képfoltokat. A modell betanítása során a szerzők egy új BPE tokenezert hoztak létre 131 ezer tokenes szókincscsel, többnyelvű szövegekre, kódokra, matematikai kifejezésekre és gépi kép-átiratokra alapozva. A pretrainelési folyamat során a modell masked discrete-diffusion célfüggvénnyel tanul, miközben a szöveges tokenek akár 100%-os elfedése is előfordulhat, ami arra kényszeríti a modellt, hogy a látható képi információkra támaszkodjon.
A NeoMME modelljei Apache 2.0 licenc alatt érhetők el a Hugging Face Transformers könyvtárában.