Bemutatta Python-verzióját a Crawlee, lehetővé teszi webes adatgyűjtést és RAG-kompatibilis exportot
A megoldás egy fejlett adatfeldolgozási folyamatot is kínál, amely egyszerűsíti a kinyert információk további hasznosítását mesterséges intelligencia rendszerekben.

A Crawlee új Python-verziója egy teljes munkafolyamatot kínál webes adatok gyűjtésére és feldolgozására. A fejlesztők beállíthatják a futtatókörnyezetet, létrehozhatnak demó weboldalakat, majd különböző módszerekkel gyűjthetnek adatokat: statikus HTML-tartalmakat, dinamikusan generált oldalakat és strukturált információkat is képesek kinyerni. (MarkTechPost)
Weboldalak és adatok konfigurációja
A tutorial bemutatja a környezet beállítását, beleértve a Pydantic, Playwright és más elemzési könyvtárak kompatibilis verzióinak telepítését. A folyamat magában foglalja a tárolási mappák konfigurálását és a szükséges környezeti változók beállítását, hogy a munkafolyamat zökkenőmentesen fusson.Kapcsolódó: AI-kódoló Anthropic
Adatkinyerési lehetőségek
A demó weboldal termékoldalakat, dokumentációt, blogbejegyzéseket és belső linkeket tartalmaz, valamint `robots.txt` szabályokat és `JSON-LD` metaadatokat is. A `BeautifulSoupCrawler` segítségével gyors, rekurzív HTML-crawling végezhető, amely kinyeri az oldal címeit, előzetes szövegeit és kimenő linkjeit.Kapcsolódó: Python biztonság ellenőrzés
A `ParselCrawler` pontos CSS- és XPath-alapú kinyerést tesz lehetővé a termékadatlapokról, míg a `PlaywrightCrawler` képes JavaScript-tartalmak renderelésére, dinamikus DOM-elemekre való várakozásra és képernyőképek készítésére.
Kapcsolódó: AI-kódolás gazdaságossága
A rendszer támogatja a RAG (Retrieval-Augmented Generation) chunk exportot, ami lehetővé teszi a tiszta szöveges darabok kinyerését metaadatokkal és `JSONL` exporttal, így az adatok könnyen felhasználhatók AI-modellek betanítására. A `Data Export Control Plane` funkció pedig adatkészletek, kulcs-érték tárolók, valamint CSV és JSON exportálását teszi lehetővé.
Kapcsolódó: Tokenhasználat csökkentés