87,6%-os pontosságot ér el az Infinity-Parser2 multimodális modell
Az Infinity-Parser2 multimodális modell 87,6%-os pontosságot ér el az olmOCR-Bench-en, 5 millió mintás adathalmazt és 3,68-szoros sebességnövekedést kínál.

Bemutatkozott az Infinity-Parser2, egy új multimodális AI-modell, amely 87,6%-os pontossággal képes dokumentumokat feldolgozni. A modell a kutatók szerint felülmúlja a DeepSeek-OCR-2, PaddleOCR-VL-1.5 és MinerU2.5 versenytársait, miközben 3,68-szor gyorsabb a korábbi, 7 milliárd paraméteres Infinity-Parser-7B modellnél — közölte az arXiv-on publikált tanulmány. (ArXiv AI)
Új adathalmaz és több feladat egyben
A kutatók egy 5 millió mintát tartalmazó, kínai és angol nyelvű dokumentumokat feldolgozó adathalmazt, az Infinity-Doc2-5M-et is nyilvánossá tették. Az Infinity-Parser2 egy vezérelhető adatszintézis-folyamatot és több feladaton futó megerősítéses tanulást (multi-task reinforcement learning) kombinál, hogy végponttól végpontig képes legyen dokumentumokat feldolgozni. A modell nyolc különböző feladatra tanul egyszerre, köztük elrendezéselemzésre, táblázat- és képletelemzésre (matematikai, kémiai), dokumentum-kérdés-válasz rendszerre (VQA) és általános multimodális megértésre.
Kapcsolódó: AI nyelvtan-javítás Kínában
Két változat a különböző igényekre
Az Infinity-Parser2 két változatban érhető el: a Flash verzió az alacsony késleltetésű feldolgozásra optimalizált, míg a Pro verzió a pontosságot helyezi előtérbe. Az Infinity-Parser2-Pro 87,6%-os eredményt ért el az olmOCR-Bench teljesítményteszten és 74,3%-ot a ParseBench-en. A modell erős általánosítási képességeket mutat táblázatok, kémiai képletek és dokumentum-VQA feladatok terén is.
Kapcsolódó: GPT-5.2 adatspecializáció
A kutatók szerint a modell felülmúlja a versenytársakat
A kutatók által végzett tesztek alapján az Infinity-Parser2 Pro verziója jobb eredményeket produkál, mint a DeepSeek-OCR-2, a PaddleOCR-VL-1.5 és a MinerU2.5 modellek. A Flash változat pedig 3,68-szor nagyobb átviteli sebességet kínál az előző generációs Infinity-Parser-7B-hez képest. A fejlesztők a modellt és az adathalmazt is nyílt forráskódúvá tették.
Kapcsolódó: PAR²-RAG pontossága