ÉlőUtoljára: 27 perceMa: 34
Kutatásfrissítve: 21:23

AI-cégek gyanúsan sok ritka könyvet vásárolnak — félő, hogy megsemmisítik őket

Az AI-cégek állítólag tömegével vásárolnak és semmisítenek meg ritka könyveket a modellképzéshez, ami aggodalomra ad okot a könyvkereskedők körében. A Google már 2009-ben szabadalmaztatott egy kíméletesebb szkennelési technológiát.

AI-cégek gyanúsan sok ritka könyvet vásárolnak — félő, hogy megsemmisítik őket
Fotó: Zdeněk Macháček / Unsplash
forrás: Ars Technica·AI Forradalom szerk.·
Megosztás

Aggodalomra ad okot a könyvkereskedők körében, hogy az AI-cégek tömegével vásárolnak fel és semmisítenek meg ritka könyveket a modellképzéshez szükséges adatok kinyerése érdekében. Bár a pontos mérték ismeretlen, a könyvbarátok attól tartanak, hogy ez a gyakorlat nagyobb léptékű lehet a jelenleg jelentetteknél, és egyes könyvek végleg elveszhetnek. A legolcsóbb és leggyorsabb módszer a könyvek fizikai megsemmisítése a szkennelés során, ami a nagy formátumú, minőségi szövegekre vágyó AI-cégek számára vonzó lehet. (Ars Technica)

Az Internet Archive, amely könyvtárakat segít az idős állományok megőrzésében, régóta felismerte, hogy az öreg könyvek szkennelése időt és figyelmet igényel. Eliza Zhang, aki 2010 óta dolgozik a szervezetnél, elmondta, hogy a „kemény módszer” a legmegfelelőbb a legértékesebb, törékeny könyvek digitalizálásához. Bár az Internet Archive tesztelt automatizált szkennereket, ezek nem bizonyultak hatékonynak a törékeny és ritka kötetek esetében.

Az Internet Archive módszerei

Zhang kiemelte, hogy a „tiszta, száraz emberi kezek a legjobb módja az oldalak forgatásának”. Minden oldal megfordítása után óvatosan felemeli a szkenner üvegét, beállítja a kamerákat, és ellenőrzi az olvashatóságot. Figyelmet fordít a kihajtható oldalakra is, hogy azok se vesszenek el.

A folyamat során a szoftver leállítja a munkát, ha egy oldalt kihagynak vagy a kép túl homályos, és felszólítja az újraszkennelésre. Zhang több mint egy évtizedes tapasztalattal alacsony hibaszázalékot produkál, és célja a „nulla hiba” elérése több mint 3 millió oldal, 14 000 kihajtható oldal és 18 000 tétel digitalizálása után.

Azonban ez a pusztítás nem szükségszerű. A Google már 2009-ben szabadalmaztatott egy kíméletesebb, roncsolásmentes könyvszkennelési technológiát, amelyet az AI-cégek is használhatnának. Ez a módszer azonban lassabb és költségesebb lehet, és a könyv ívének görbülete torzíthatja a szöveget, vagy a gyors munkavégzés során a dolgozók keze elfedheti az oldalakat. Ezek a kompromisszumok nem biztos, hogy vonzóak a legolcsóbb megoldásokat kereső cégek számára.

Gyanús rendelések és a jövő

A nyári, 2025-ös peres ügy óta, amelyben kiderült, hogy az Anthropic több millió könyvet semmisített meg AI-modelljeinek képzéséhez, a könyvbarátok igyekeznek megvédeni a legértékesebb gyűjteményeket. A legnagyobb félelem, hogy az AI-cégek meggondolatlanul pulppá teszik a pótolhatatlan ritka könyveket. A közelmúltbeli jelentések szerint a Szilícium-völgy állítólag millió számra pusztított el ritka könyveket, és egy ISBNdb nevű adatbázis-cég segít AI-cégeknek tömeges könyvbeszerzésben.

Bár az Anthropic tagadja, hogy ritka könyveket semmisített volna meg, és egyes cégek, mint az OpenAI és a Microsoft, együttműködnek a Harvarddal könyvek digitalizálásában, mások, mint az xAI, nem győzték meg a kritikusokat. Elon Musk azt ígérte, hogy megőrzik a ritka könyveket, de nem egyértelmű, hogyan definiálják a „ritka” fogalmát. Az ír Kennys könyvesbolt nemrégiben egy 5000 furcsa címet tartalmazó, gyanús rendelést jelzett, ahol az áralku hiánya vörös zászló volt.

Forrás

Feldolgozott sajtóforrás·Ars Technica

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom