PDF-ek tartalomjegyzékét állítja helyre az új módszer, hogy a RAG jobban szekciózzon
A Kezhan Shi által kifejlesztett kétlépéses technika a nyomtatott tartalomjegyzékeket használja fel, hogy a dokumentumok szekcióhierarchiáját visszaállítsa.

Sok PDF-dokumentum esetében előfordul, hogy bár tartalmaznak egy nyomtatott tartalomjegyzéket, a digitális fájl nem őrzi meg ezt a szerkezetet, így a gépi feldolgozás számára láthatatlan marad. Ez komoly problémát jelent a Retrieval-Augmented Generation (RAG) rendszerek számára, amelyek a dokumentumok szekciói alapján végeznek lekérdezést, chunkolást és összefoglalást. Kezhan Shi a Towards Data Science Enterprise Document Intelligence blogján mutatott be egy módszert ennek orvoslására.
A probléma: Látható, de nem használható tartalomjegyzék
Amikor egy PDF-fájlban nincs natív outline (a PyMuPDF `doc.get_toc()` által visszaadott adat), akkor a dokumentum szekcióstruktúrája, azaz a `toc_df` adatkeret üresen marad. Ez még akkor is megtörténhet, ha a dokumentum egy jól olvasható tartalomjegyzéket jelenít meg az egyik oldalán. Ilyenkor a RAG-rendszer kénytelen az egész dokumentumot átvizsgálni, a chunkolás vak oldaltörésekre korlátozódik, és az összefoglalás elveszíti a dokumentum saját logikai felépítését. A NIST FIPS 202 szabvány például ilyen eset.
Kapcsolódó: LLM-hallucináció-szűrés
A megoldás: Kétlépéses rekonstrukció
A probléma megoldására Shi kétlépéses megközelítést javasol. Az első lépés a tartalomjegyzék bejegyzéseinek kiolvasása, beleértve a címeket és a hierarchiát. A második, kritikus lépés pedig ezeknek a bejegyzéseknek a fizikai oldalszámokhoz való igazítása. Ez utóbbi lépés gyakran elmarad a dokumentumfeldolgozás során, pedig elengedhetetlen a `toc_df` helyes felépítéséhez.
Kapcsolódó: Vectorless RAG sebessége
Esetek és költségek: A szerencséstől a legnehezebbig
A módszer három fő esetet különböztet meg, növekvő költséggel és bonyolultsági szinttel. Az első eset, amikor a PDF-nek van natív outline-ja – ez az ideális helyzet, és ingyenesen feldolgozható. A második eset, amikor a dokumentum ugyan nem rendelkezik natív outline-nal, de a tartalomjegyzék kattintható hiperhivatkozásokat tartalmaz, amelyek közvetlenül a fizikai oldalakra mutatnak. A NIST Cybersecurity Framework ilyen. A harmadik, leggyakoribb eset pedig, amikor a tartalomjegyzék csak nyomtatott formában létezik, címekkel, pontokkal és oldalszámokkal, de nincsenek mögötte digitális linkek. Ez utóbbi igényel komolyabb feldolgozást.
Kapcsolódó: dokumentumértelmezés javítása
A linkek követése és a fizikai oldalak megtalálása
A második eset, a linkekkel ellátott tartalomjegyzék, a legkedvezőbb, mivel a dokumentum maga oldja meg az oldaltérképezést. A PyMuPDF képes kiolvasni ezeket a belső linkeket, és hozzárendelni a szöveges címeket a céloldalakhoz. A `extract_toc_from_links` függvény például egy sűrűségellenőrzéssel azonosítja a navigációs oldalakat, majd összekapcsolja a linkeket a hozzájuk tartozó szöveggel, így pontosan visszaállítva a szekciók listáját és azok fizikai kezdőoldalát.
Kapcsolódó: RAG hibák elemzése
A nyomtatott tartalomjegyzék feldolgozása
A harmadik eset, a linkek nélküli nyomtatott tartalomjegyzék, a legnehezebb. Itt a kiolvasott címeket és oldalszámokat manuálisan kell hozzárendelni a fizikai oldalakhoz. A módszer két fő lépésből áll: először a tartalomjegyzék bejegyzéseit olvassák ki, majd ezeket igazítják a dokumentum fizikai oldalaihoz. A helyreállított TOC jelentősen javíthatja a RAG rendszer teljesítményét a dokumentum-szintű lekérdezés, a chunkolás és a szekció-szerinti összefoglalás terén, és a szerző tapasztalata szerint általánosan alkalmazható a legtöbb vállalati dokumentumra.
Kapcsolódó: Midjourney webdizájn innovációja