Az NVIDIA új eszközt ad ki a dokumentumok AI-elemzéséhez
Az NVIDIA új eszköze, a NeMo Retriever lehetővé teszi multimodális RAG-folyamat építését, amely offline PDF-szövegkinyerést, NIM-végpontokat és LanceDB-tárolást foglal magában.

Az NVIDIA bemutatta új eszközét, a NeMo Retrievert, amely egy fejlett multimodális RAG (Retrieval-Augmented Generation) folyamat kiépítését teszi lehetővé. A folyamat magában foglalja az offline PDF-szövegkinyerést, amelyhez nincs szükség GPU-ra vagy külső API-kulcsra. A rendszer ezután kibővíthető a hosztolt NVIDIA NIM végpontokkal, hogy felismerje az oldalelemeket, kinyerje a táblázatokat, diagramokat és infografikákat, valamint sűrű vektoros beágyazásokat generáljon. (MarkTechPost)
Tárolás és lekérdezési lehetőségek
A feldolgozott tartalmat a LanceDB-ben tárolják, ami hatékony lekérdezést tesz lehetővé. A folyamat támogatja a sűrű lekérdezést, a látás-nyelv alapú átrendezést (vision-language reranking), a metaadat-szűrt keresést, valamint a hivatkozásokkal ellátott, megalapozott válaszgenerálást. Az NVIDIA egy könnyűsúlyú recall-at-k értékelést is biztosít a multimodális dokumentumok lekérdezési minőségének validálására.
Implementációs lépések
A folyamat első lépéseként konfigurálják a Python 3.12 környezetet, telepítik a szükséges csomagokat, és elvégzik az offline PDF-szövegkinyerést a PDFium metódussal. Ezt követően a hosztolt NVIDIA NIM végpontokat használják a multimédia elemek (táblázatok, infografikák) felismerésére és kinyerésére, majd a tartalom LanceDB-be történő feltöltésére kerül sor.