AI-generált blogbejegyzéseket 98%-os pontossággal szűri a Sitefire új rendszere
A Sitefire új osztályozója 98%-os pontossággal képes megkülönböztetni az emberi és AI-generált blogbejegyzéseket a szerkezeti jellemzők alapján, mindössze 19 hibát vétve 1740 elemzés során.

A Sitefire (YC W26) új modellt fejlesztett, amely pusztán a weboldalak szerkezeti felépítéséből képes felismerni az AI által generált tartalmakat. A kutatás, amelyet a Hacker News-on mutattak be, 98%-os pontosságot ért el az emberi és gépi szövegek megkülönböztetésében.
A Stanfordon és a müncheni Műszaki Egyetemen (TUM) szerzett tapasztalatokkal rendelkező Vincent és Jochen által alapított Sitefire eredetileg marketingcsapatokat segít az AI-keresőkben való jobb ajánláshoz. Mivel a cégnek kereskedelmi érdekeltsége van az AI-generált tartalmakban, felmerült a kérdés, mi jellemzi az „AI-szemetet”, és hogyan lehet azt azonosítani.
Az emberi és gépi szövegek szerkezeti különbségei
A kutatók a Marylandi Egyetem és a Google DeepMind StoryScope nevű, fikciós szövegekre vonatkozó tanulmányát vették alapul. A Wayback Machine segítségével 2250, a ChatGPT megjelenése előtt írt blogbejegyzést gyűjtöttek össze 268 B2B weboldalról. Ezekhez öt különböző AI modell – GPT-5.4, Claude Sonnet 4.6, Gemini 3 Flash, DeepSeek V3.2 és Kimi K2.5 – írta meg a saját változatát.
Az elemzés nem a szavakat, hanem a bejegyzések felépítését vizsgálta. Egy AI-modell 214 kérdésre válaszolt minden posztról, például arról, mennyire népszerűsíti a saját termékét, alátámasztja-e állításait forrásokkal, vagy idéz-e megnevezett szakértőt. Ezekre az válaszokra építve tanították be a végső osztályozót.
Az ismétlődés és a szerkezeti csoportosulás
Az új, eddig ismeretlen blogbejegyzéseken végzett tesztek során az osztályozó 98%-os pontossággal tudta megkülönböztetni az AI- és emberi eredetű tartalmakat, mindössze 19 téves azonosítással 1740 elemzésből. A siker oka, hogy az öt AI modell hasonló „alakban” ír, értékeik szorosan csoportosulnak, míg az emberi bejegyzések értékei szélesebb spektrumon szóródnak. Az 1% leginkább egyedi poszt közül 149 emberi, míg csupán 4 AI által írt.
Az AI-tartalmak jellegzetessége, hogy gyakran ismétlik önmagukat: a cím már megígéri, mit kap az olvasó, a bevezető felvázolja a tartalmat, a befejezés pedig újra elismétli a fő üzenetet. Az AI-posztok 77%-a ismétli a lényeget a végén, szemben az emberi posztok 12%-ával. Ezt a jelenséget „gondos, önmagát bejelentő blogbejegyzésnek” nevezik.
Az AI-szerzők azonosítása
A különböző AI modelleknek azonban saját „akcentusuk” van. Egy második osztályozót is betanítottak, amely képes volt 79%-os pontossággal megmondani, melyik a szerző (az öt AI modell vagy emberi író), bár a tévedések főként az AI modellek keveredéséből adódtak, nem pedig emberi és AI tartalom összekeveréséből.
A kutatás eredményeit a Sitefire a jövőben arra használja, hogy segítsen a marketingcsapatoknak az AI-generált tartalmak kiszűrésében, miközben továbbra is kihasználják az AI előnyeit a tartalomgyártásban. A Sitefire célja, hogy a modellek fejlődésével is stabilan működőképes maradjon az azonosító rendszer.