10 gyakori hiba a RAG rendszerekben a Towards Data Science oldalán
A dokumentumok szerkezetének figyelmen kívül hagyása pontatlan válaszokat és megnövekedett költségeket eredményez. A helyes feldolgozás kulcsfontosságú.

A dokumentumok feldolgozása gyakran elbukik a RAG-rendszerekben, amikor a csapatok szövegként kezelik a dokumentumokat, nem pedig strukturált objektumként. Ez a hiba a dokumentumok szerkezetének elvesztéséhez vezet, ami pontatlan vagy kétértelmű eredményeket produkál. A probléma különösen akkor jelentkezik, amikor táblázatokat, több oszlopos elrendezést vagy fejléc-lábléc információkat kell kezelni.
A táblázatok elvesztik csoportosításukat
Az egyik leggyakoribb hiba, hogy a dokumentumot csupán egyetlen szövegtömbbé alakítják, és az LLM-re bízzák a rendezést. Ez különösen akkor okoz gondot, ha egy táblázatban azonos nevű sorok (pl. Premium, Deductible) különböző kategóriák (Health, Dental) alá tartoznak. A lapos szövegben ezek a kategóriák eltűnnek, és az LLM két lehetséges válasz közül választ, gyakran tévesen.
Kapcsolódó: Anchor rendszer
A teljes dokumentum betöltése minden kérdésre
Egy másik gyakori tévedés, amikor a teljes dokumentumot, például egy 1200 oldalas szerződést, minden egyes lekérdezéskor betöltik a promptba. Ez a módszer gyorsan elképesztően drága lehet, különösen nagy dokumentumok és napi több száz kérdés esetén. Ahelyett, hogy a teljes dokumentumot átkutatnák, a célzott megközelítés a dokumentum egyszeri feldolgozása, majd a lekérdezéshez legrelevánsabb részek visszakeresése.
Kapcsolódó: AI-ügynök bemutatása
A chunk_size finomhangolása nem elegendő
A harmadik feldolgozási hiba az az elképzelés, hogy a PDF csupán egy szöveges string. A csapatok gyakran a `pdfplumber` vagy `PyMuPDF` könyvtárakat használva kinyerik a szöveget, majd a `RecursiveCharacterTextSplitter` segítségével próbálják optimalizálni a `chunk_size`-t és `chunk_overlap`-et.
Kapcsolódó: LLM-összefoglalók
A kutatók, Kezhan Shi és Angela Shi szerint ezek a hibák gyakoriak a termelési RAG-rendszerekben, és jelentős hatással vannak a pontosságra és a költségekre. A dokumentumok strukturált feldolgozása, nem pedig pusztán szöveggé alakítása, kulcsfontosságú a megbízható és hatékony RAG-alkalmazásokhoz, mint például a Towards Data Science által bemutatott megoldásoknál, ahol a célzott megközelítés az éves költséget 131 000 dollárról 330 dollárra csökkentheti.
Kapcsolódó: AI-benchmark