ÉlőUtoljára: 10 perceMa: 16
Kutatásfrissítve: 08:16

AI-generált blogbejegyzéseket 98%-os pontossággal szűri a Sitefire új rendszere

A Sitefire új osztályozója 98%-os pontossággal képes megkülönböztetni az emberi és AI-generált blogbejegyzéseket a szerkezeti jellemzők alapján, mindössze 19 hibát vétve 1740 elemzés során.

AI-generált blogbejegyzéseket 98%-os pontossággal szűri a Sitefire új rendszere
Fotó: Kaitlyn Baker / Unsplash
forrás: Hacker News·AI Forradalom szerk.·
Megosztás

A Sitefire (YC W26) új modellt fejlesztett, amely pusztán a weboldalak szerkezeti felépítéséből képes felismerni az AI által generált tartalmakat. A kutatás, amelyet a Hacker News-on mutattak be, 98%-os pontosságot ért el az emberi és gépi szövegek megkülönböztetésében.

A Stanfordon és a müncheni Műszaki Egyetemen (TUM) szerzett tapasztalatokkal rendelkező Vincent és Jochen által alapított Sitefire eredetileg marketingcsapatokat segít az AI-keresőkben való jobb ajánláshoz. Mivel a cégnek kereskedelmi érdekeltsége van az AI-generált tartalmakban, felmerült a kérdés, mi jellemzi az „AI-szemetet”, és hogyan lehet azt azonosítani.

Az emberi és gépi szövegek szerkezeti különbségei

A kutatók a Marylandi Egyetem és a Google DeepMind StoryScope nevű, fikciós szövegekre vonatkozó tanulmányát vették alapul. A Wayback Machine segítségével 2250, a ChatGPT megjelenése előtt írt blogbejegyzést gyűjtöttek össze 268 B2B weboldalról. Ezekhez öt különböző AI modell – GPT-5.4, Claude Sonnet 4.6, Gemini 3 Flash, DeepSeek V3.2 és Kimi K2.5 – írta meg a saját változatát.

Az elemzés nem a szavakat, hanem a bejegyzések felépítését vizsgálta. Egy AI-modell 214 kérdésre válaszolt minden posztról, például arról, mennyire népszerűsíti a saját termékét, alátámasztja-e állításait forrásokkal, vagy idéz-e megnevezett szakértőt. Ezekre az válaszokra építve tanították be a végső osztályozót.

Az ismétlődés és a szerkezeti csoportosulás

Az új, eddig ismeretlen blogbejegyzéseken végzett tesztek során az osztályozó 98%-os pontossággal tudta megkülönböztetni az AI- és emberi eredetű tartalmakat, mindössze 19 téves azonosítással 1740 elemzésből. A siker oka, hogy az öt AI modell hasonló „alakban” ír, értékeik szorosan csoportosulnak, míg az emberi bejegyzések értékei szélesebb spektrumon szóródnak. Az 1% leginkább egyedi poszt közül 149 emberi, míg csupán 4 AI által írt.

Az AI-tartalmak jellegzetessége, hogy gyakran ismétlik önmagukat: a cím már megígéri, mit kap az olvasó, a bevezető felvázolja a tartalmat, a befejezés pedig újra elismétli a fő üzenetet. Az AI-posztok 77%-a ismétli a lényeget a végén, szemben az emberi posztok 12%-ával. Ezt a jelenséget „gondos, önmagát bejelentő blogbejegyzésnek” nevezik.

Az AI-szerzők azonosítása

A különböző AI modelleknek azonban saját „akcentusuk” van. Egy második osztályozót is betanítottak, amely képes volt 79%-os pontossággal megmondani, melyik a szerző (az öt AI modell vagy emberi író), bár a tévedések főként az AI modellek keveredéséből adódtak, nem pedig emberi és AI tartalom összekeveréséből.

A kutatás eredményeit a Sitefire a jövőben arra használja, hogy segítsen a marketingcsapatoknak az AI-generált tartalmak kiszűrésében, miközben továbbra is kihasználják az AI előnyeit a tartalomgyártásban. A Sitefire célja, hogy a modellek fejlődésével is stabilan működőképes maradjon az azonosító rendszer.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom