ÉlőUtoljára: 51 perceMa: 4
Eszközökfrissítve: 18:10

PDF-ek tartalomjegyzékét állítja helyre az új módszer, hogy a RAG jobban szekciózzon

A Kezhan Shi által kifejlesztett kétlépéses technika a nyomtatott tartalomjegyzékeket használja fel, hogy a dokumentumok szekcióhierarchiáját visszaállítsa.

PDF-ek tartalomjegyzékét állítja helyre az új módszer, hogy a RAG jobban szekciózzon
Fotó: Ashishan kujur / Unsplash
forrás: Towards Data Science·AI Forradalom szerk.·
Megosztás

Sok PDF-dokumentum esetében előfordul, hogy bár tartalmaznak egy nyomtatott tartalomjegyzéket, a digitális fájl nem őrzi meg ezt a szerkezetet, így a gépi feldolgozás számára láthatatlan marad. Ez komoly problémát jelent a Retrieval-Augmented Generation (RAG) rendszerek számára, amelyek a dokumentumok szekciói alapján végeznek lekérdezést, chunkolást és összefoglalást. Kezhan Shi a Towards Data Science Enterprise Document Intelligence blogján mutatott be egy módszert ennek orvoslására.

A probléma: Látható, de nem használható tartalomjegyzék

Amikor egy PDF-fájlban nincs natív outline (a PyMuPDF `doc.get_toc()` által visszaadott adat), akkor a dokumentum szekcióstruktúrája, azaz a `toc_df` adatkeret üresen marad. Ez még akkor is megtörténhet, ha a dokumentum egy jól olvasható tartalomjegyzéket jelenít meg az egyik oldalán. Ilyenkor a RAG-rendszer kénytelen az egész dokumentumot átvizsgálni, a chunkolás vak oldaltörésekre korlátozódik, és az összefoglalás elveszíti a dokumentum saját logikai felépítését. A NIST FIPS 202 szabvány például ilyen eset.

Kapcsolódó: LLM-hallucináció-szűrés

A megoldás: Kétlépéses rekonstrukció

A probléma megoldására Shi kétlépéses megközelítést javasol. Az első lépés a tartalomjegyzék bejegyzéseinek kiolvasása, beleértve a címeket és a hierarchiát. A második, kritikus lépés pedig ezeknek a bejegyzéseknek a fizikai oldalszámokhoz való igazítása. Ez utóbbi lépés gyakran elmarad a dokumentumfeldolgozás során, pedig elengedhetetlen a `toc_df` helyes felépítéséhez.

Kapcsolódó: Vectorless RAG sebessége

Esetek és költségek: A szerencséstől a legnehezebbig

A módszer három fő esetet különböztet meg, növekvő költséggel és bonyolultsági szinttel. Az első eset, amikor a PDF-nek van natív outline-ja – ez az ideális helyzet, és ingyenesen feldolgozható. A második eset, amikor a dokumentum ugyan nem rendelkezik natív outline-nal, de a tartalomjegyzék kattintható hiperhivatkozásokat tartalmaz, amelyek közvetlenül a fizikai oldalakra mutatnak. A NIST Cybersecurity Framework ilyen. A harmadik, leggyakoribb eset pedig, amikor a tartalomjegyzék csak nyomtatott formában létezik, címekkel, pontokkal és oldalszámokkal, de nincsenek mögötte digitális linkek. Ez utóbbi igényel komolyabb feldolgozást.

Kapcsolódó: dokumentumértelmezés javítása

A linkek követése és a fizikai oldalak megtalálása

A második eset, a linkekkel ellátott tartalomjegyzék, a legkedvezőbb, mivel a dokumentum maga oldja meg az oldaltérképezést. A PyMuPDF képes kiolvasni ezeket a belső linkeket, és hozzárendelni a szöveges címeket a céloldalakhoz. A `extract_toc_from_links` függvény például egy sűrűségellenőrzéssel azonosítja a navigációs oldalakat, majd összekapcsolja a linkeket a hozzájuk tartozó szöveggel, így pontosan visszaállítva a szekciók listáját és azok fizikai kezdőoldalát.

Kapcsolódó: RAG hibák elemzése

A nyomtatott tartalomjegyzék feldolgozása

A harmadik eset, a linkek nélküli nyomtatott tartalomjegyzék, a legnehezebb. Itt a kiolvasott címeket és oldalszámokat manuálisan kell hozzárendelni a fizikai oldalakhoz. A módszer két fő lépésből áll: először a tartalomjegyzék bejegyzéseit olvassák ki, majd ezeket igazítják a dokumentum fizikai oldalaihoz. A helyreállított TOC jelentősen javíthatja a RAG rendszer teljesítményét a dokumentum-szintű lekérdezés, a chunkolás és a szekció-szerinti összefoglalás terén, és a szerző tapasztalata szerint általánosan alkalmazható a legtöbb vállalati dokumentumra.

Kapcsolódó: Midjourney webdizájn innovációja

Forrás

Feldolgozott sajtóforrás·Towards Data Science

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom