ÉlőUtoljára: 1 órájaMa: 3
Eszközökfrissítve: 18:10

Az image_df megtalálja a PDF-képeket, de csak a lényegeseket dolgozza fel

Az image_df új módszere minden képet azonosít a PDF-ben anélkül, hogy azokat beolvasná, majd olcsó szűrőkkel dönti el, melyek érik meg a feldolgozást.

Az image_df megtalálja a PDF-képeket, de csak a lényegeseket dolgozza fel
Fotó: Team Nocoloco / Unsplash
forrás: Towards Data Science·AI Forradalom szerk.·
Megosztás

A dokumentum-parsing téglája, az image_df minden PDF-ben található képhez egy sort generál, amely tartalmazza az oldalszámot, a kép helyét, méretét és egy tartalom-hashelést. Ez azonosítja az összes képet, de nem mondja meg, mit ábrázolnak. A kereséshez ez nem elegendő, ezért a feladat két részre oszlik: egyrészt a képek szöveggé alakításának módszerei és költségei, másrészt annak eldöntése, mely képek érik meg a feldolgozást egy adott futtatás során. A szerző, Kezhan Shi szerint a legtöbb kép nem éri meg a modellhívást, így a cél a költséghatékony feldolgozás. (Towards Data Science)

A legtöbb kép nem éri meg a modellhívást

Az első lépés költségmentes. Mielőtt bármilyen OCR- vagy látásmodell-hívás történne, egy olcsó szűrő vizsgálja az image_df-ben található jeleket és néhány képpontstatisztikát. Ez eltávolítja azokat a képeket, amelyeknek nincs keresési értéke: túl kicsik, rossz alakúak (pl. nagyon hosszú és vékony), vagy ismétlődnek a dokumentum nagy részén (pl. logó, vízjel). A is_worth_analyzing és flag_worth_analyzing funkciók alkalmazzák ezeket a szabályokat, és egy worth_analyzing oszlopot adnak hozzá az image_df-hez. A szűrőküszöbök szándékosan lazák, így ha kétség merül fel, a szűrő megtartja a képet, hogy elkerülje a tartalom elvesztését. Ez a lépés a képek túlnyomó többségét eltávolítja, mielőtt bármelyik modell futna.

Kapcsolódó: AI-módszer dokumentumértésre

Képosztályozás és költséghatékonyság

A szűrőn átjutott képeket nem mindegyik módszerrel dolgozzák fel. Egy táblázatról készült képernyőképhez klasszikus OCR elegendő, míg egy diagram vagy fotó tartalmának megértéséhez látásmodellre van szükség. A classify_image funkció az olcsó képpontjelek alapján osztályozza a képeket: dekoratív, szöveges, diagram/fotó. A cél az, hogy csak azokat a képeket dolgozzák fel, amelyek valóban releváns információt hordoznak, elkerülve a felesleges költségeket. A bias aszimmetrikus: egy kihagyott OCR-parancs egy látásmodell-hívásba kerül, míg egy diagramra futtatott OCR csak elszórt tengelycímkéket és értelmetlen szöveget eredményez. Ezért a rendszer inkább a látásmodellt választja, ha kétséges a helyzet.

Kapcsolódó: Vectorless RAG gyorsít

A szerző, Kezhan Shi szerint a szűrőküszöbök lazák, így előfordulhat, hogy néhány nem releváns képet mégis feldolgoznak, vagy egyes fontos képeket kihagynak. A „legtöbb kép nem éri meg a modellhívást” állítás a szerző heuristikáján alapul, független validáció nélkül. A rendszer célja, hogy a képfeldolgozás költségeit a lehető legalacsonyabban tartsa a RAG-alapú vállalati dokumentumintelligencia keretein belül.

Kapcsolódó: LiteParse PDF-kivonás böngészőben

Forrás

Feldolgozott sajtóforrás·Towards Data Science

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom