Régi OCR-hibák lassítják az AI-képzést: a FineBooks javítana rajta
A Hugging Face és az EleutherAI FineBooks projektje 14 nyílt OCR modellt tesztelt történelmi könyveken. A legjobb modellek 97,6%-os karakterpontossággal dolgozzák fel a szöveget, ami elegendő az AI-képzéshez, de tudományos célra még nem.
A régi, hibás optikai karakterfelismerő (OCR) technológiával készült szövegek lassítják az AI-nyelvmodellek képzését. A Hugging Face és az EleutherAI által indított FineBooks projekt 14 nyílt forráskódú OCR-modell teljesítményét mérte fel több mint 2000 történelmi könyvoldalon, hogy megvizsgálja, mennyire alkalmasak a beolvasott szövegek tisztítására és AI-képzési adatokká alakítására. (The Decoder)
A kutatás eredményei szerint a kisebb modellek gyakran felülmúlták a nagyobbakat. A legjobb, dots.mocr nevű modell 97,6%-os karakterpontosságot ért el, miközben az ezer oldalra jutó költsége kevesebb mint 2 dollár volt. Bár a kutatók szerint az OCR-kimenet minősége elegendő az AI-képzési célokra, a modellek még mindig túl hibásak tudományos vagy szakmai alkalmazásokhoz.
Kisebb modellek, nagyobb pontosság
A FineBooks projekt 2165 történelmi könyvoldalon tesztelt 14 nyílt súlyú OCR-modellt. Az eredmények egy rangsorban jelentek meg. A legjobb modellek 97%-os karakterpontosságot értek el, kevesebb mint 2 dolláros költséggel ezer oldalanként. Érdekesség, hogy a méret és a pontosság nem korrelált: a 3 milliárd paraméteres dots.mocr modell jobban teljesített, mint a majdnem háromszor nagyobb, 9,7 milliárd paraméteres Qwen3.5-9B.
Milliók várnak jobb feldolgozásra
Az EleutherAI tavaly kiadott Common Pile nevű, nyílt licencelésű képzési korpusza mintegy 300 000 nyilvánosan elérhető könyvet tartalmazott, amelyek szövege régebbi OCR-futtatásokból származott. A FineBooks szerzői szerint ezeknek a könyveknek a jobb modellekkel történő újrafeldolgozása az egyik leghatékonyabb módja a nyílt AI-képzési adathalmazok javításának. A projekt célpontja a Biodiversity Heritage Library (BHL) lett, amely több mint 300 000 digitalizált természetrajzi dokumentumot, összesen több mint 64 millió oldalt őriz.
Tudományos használatra még nem
A modellek értékelése a tervezett felhasználás szerint történt. Nyelvmodellek képzéséhez a legjobb eredményt elérő modellek jól működnek, írják a szerzők. Kevesebb hibát produkálnak, mint a régebbi rendszerek, és a BHL méretű gyűjtemény újrafeldolgozása a mért költségeken reálisnak tűnik. A könyvtárak rendszerei azonban ALTO XML formátumot használnak szó-szintű koordinátákkal, amit az új modellek nem támogatnak, mivel Markdown vagy egyszerű szöveget adnak ki szópozíciók nélkül.
A tudományos átiratok pontossága még mindig nem elegendő, nemcsak a karakterhibák miatt, hanem mert a modellek csendben modernizálják a szövegeket, például a hosszú „s” vagy ligatúrák modern megfelelőire cserélésével. A csapat szerint célzott finomhangolással ez javítható lenne.
A FineBooks projekt a tervek szerint mintegy 200 000 nyilvánosan elérhető BHL dokumentumot dolgoz fel az egyik legjobb modellel, és a szöveget nyílt adathalmazként teszi közzé.