Az új GLiFormer modell 91,10 F1 pontszámot ért el a Knowledgator
A Knowledgator GLiFormer Large modellje 91,10 F1 pontszámot ért el nested JSON kivonásban, miközben nem generál tokeneket, hanem közvetlenül a forrásból dolgozik.

A GLiFormer Large 575,6 millió paraméterrel rendelkezik, míg a Base verzió 264,2 milliót tartalmaz. A két checkpoint is Apache 2.0 licenc alatt érhető el a Hugging Face-en, és pip-pel telepíthető. Az inference során címkéket és extrakciós sémákat kell megadni, a modell pedig egyetlen alapműveletet végez: a forrás kódolását, a kért koncepciók reprezentálását és azok kompatibilitásának pontozását. (MarkTechPost)
Hogyan működik a GLiFormer
A rendszer a GLiNER-re épül, az 'anchor' objektum általánosítja a címkemegfeleltetést. Ez lehet csoportvektor, entitáspár vagy rekord slot. A forrás egyszer kódolódik, majd több séma futtatható ugyanazon a dokumentumon. A struktúra négy szakaszban fut: az értékek forrásból vett span-okként rögzülnek, rendezetlen rekord slotokhoz rendelődnek, majd irányított szülő-gyermek kapcsolatok predikálódnak. A nested JSON összeállítása determinisztikus dekóderrel történik, így a modell nem tud olyan szöveges értékeket kitalálni, amelyek hiányoznak a bemenetből.
Teljesítmény és sebesség
A GLiFormer Large 91,10 F1 pontszámot ért el nested JSON kivonásban, a Base verzió pedig 87,20 F1-et produkált. Klasszifikációban a Large 75,03, a Base 72,36 átlagos macro-F1-et ért el. A GLiFormer-base median latenciája 69 ms volt NVIDIA RTX PRO 6000 Blackwell GPU-n FP16-ban, míg 547 ms egy 8-szálas AMD EPYC 9B45 CPU-n FP32-ban. A modellek önállóan hostolhatók CPU-n vagy GPU-n, a relációkinyeréshez a 'joint_relations' használata javasolt a v1 checkpointoknál.