ÉlőUtoljára: 45 perceMa: 18
Kutatásfrissítve: 10:19

Új módszerrel tárhatók fel az AI-modellek rejtett gondolatmenetei

Új módszerrel nyerhetők ki az AI-modellek rejtett gondolatmenetei, ami arra utal, hogy egyes kínai modellek amerikai nagyágyúk titkosított gondolatmeneteit másolhatták. A kutatás biztonsági rést is feltárt, amelyen keresztül jelszavak és API-kulcsok szivároghattak ki.

Új módszerrel tárhatók fel az AI-modellek rejtett gondolatmenetei
Fotó: Winston Chen / Unsplash
forrás: Wired·AI Forradalom szerk.·
Megosztás

„Az általunk tesztelt összes nagy, élenjáró modellgyártó ugyanazzal a sebezhetőséggel rendelkezik” — közölte Alexander Panfilov, a németországi Tübingeni Egyetem kutatója. „Ez személyes adatok kiszivárgásához vezethet, és lehetővé teszi nagyszabású, gondolat-desztillációs támadásokat.” (Wired)

Azonosított sebezhetőségek és modellhasonlóságok

Panfilov és kollégái a Tübingeni Egyetemről, a Max Planck Intézetből, az MATS Research AI-biztonsági intézetből és a Snyk biztonsági cégtől azonosították a problémát az OpenAI, az Anthropic és a Google API-n keresztül elérhető modelljeinél. Egy tanulmányban a kutatók bemutatják, hogy a Moonshot AI nyílt forráskódú Kimi K3 modellje meglepően hasonló kimenetet produkál bizonyos utasítások esetén, mint a Claude Opus 4.8 és a GPT 5.6 Sol rejtett gondolati nyomai.

A kutatók ugyanakkor megjegyzik, hogy munkájuk „nem tudja kauzálisan megállapítani a desztillációt”. Két másik nyílt forráskódú modell, a kínai DeepSeek és az amerikai Thinking Machines Inkling nem mutatott ilyen gondolati hasonlóságot a Claude Opusszal.

Desztilláció és geopolitikai vetületek

A desztilláció egy elterjedt technika, amellyel hatékonyan másolhatók át a meglévő modellek képességei új modellekre, különösen a nyílt forráskódú vagy letölthető modellek fejlesztésénél. A közelmúltban a desztilláció ellentmondásos témává vált, mivel felmerült a gyanú, hogy kínai AI-cégek ezt a módszert használják a legjobb amerikai modellek lemásolására.

Februárban az OpenAI amerikai törvényhozóknak jelezte, hogy a DeepSeek úgy tűnik, lemásolt egy modelljüket az R1 nevű gondolati modelljük felépítéséhez. Júniusban az Anthropic közölte, hogy az Alibaba szisztematikusan desztillálta modelljeiket a sajátjuk, a Qwen felépítéséhez. Nincs arra utaló jel, hogy kínai AI-cégek ezt a konkrét technikát használták volna amerikai AI-modellek desztillálására.

A kutatók módszere azonban lehetővé tenné, hogy több információt desztilláljanak a zárt modellekből, mint korábban gondolták. A nagyobb, fejlettebb AI-modellek titkosítják a gondolati nyomokat, mielőtt elküldik a felhasználónak, hogy megakadályozzák a lemásolást.

A kutatók felfedezték, hogy ha ezeket a titkosított nyomokat egy kisebb, kevésbé „igazított” (aligned) modellváltozatnak adják át, amely ugyanazzal a dekódolási kulccsal rendelkezik, de gyengébb a beállításokon, akkor a modell felfedi rejtett gondolatait. Ez a módszer biztonsági réseket is feltárt, beleértve API-kulcsokat és jelszavakat, amelyeket a felhasználó gépéről rögzített gondolati nyomokba ágyaztak. Az OpenAI, az Anthropic és a Google mindannyian módosították API-jukat a probléma elhárítása érdekében.

„Értékeljük az általunk fejlesztett modellekkel kapcsolatos független kutatásokat, és megkezdtük rövid távú enyhítések kidolgozását a jelentésben leírt viselkedési mintákra” — nyilatkozta Michael Aciman, az Anthropic szóvivője. Hozzátette, hogy a kutatás nem járt titkosítási kulcsok visszanyerésével, az Anthropic infrastruktúrájához való hozzáféréssel vagy személyes adatok rendszerükből való kinyerésével. A Google és az OpenAI nem kívánt nyilatkozni.

A desztilláció geopolitikai kérdéssé vált az elmúlt hónapokban, ahogy az amerikai és kínai vállalatok egyre erősebb modellekkel versengenek az AI-fölényért. A kínai AI-cégek állítólag stratégiai előnyre tesznek szert az amerikai technológia desztillálásával, hogy olcsóbban futtatható nyílt forráskódú modelleket hozzanak létre.

Mások szerint a desztilláció egy széles körben használt módszer az AI képességeinek gyors növelésére. Mark Zuckerberg, a Meta vezérigazgatója szerint a desztilláció „fontos elve a nyílt forráskódú ökoszisztéma működésének”, és figyelmeztetett, hogy a gyakorlat korlátozása hátrányba hozná az Egyesült Államokat.

A kutatók 90 kérdést adtak át a modelleknek, hogy teszteljék, vajon a nyílt forráskódú modellek desztillálhattak-e zártakból. Amikor néhány nyílt modellnek megadták a zárt modellekből rögzített gondolati nyomok első néhány szavát, néha észrevették, hogy ezek a nyílt modellek meglepően hasonló válaszokat generálnak. Ez különösen a Kimi K3 esetében volt hangsúlyos.

Korábban már felmerültek találgatások a kínai közösségi médiában arról, hogy lehetséges lehet rejtett gondolati nyomokat felfedezni és felhasználni desztillációra. Yarin Gal, az Oxfordi Egyetem kutatója szerint a desztilláció nemcsak széles körben használt, hanem segítette is az AI gyorsabb fejlődését. „Ha az a norma, hogy mindenki blokkolja a másikat [a desztillációban], annak is következményei lesznek a haladás ütemére” — mondta.

Yarin Gal, az Oxfordi Egyetem kutatója hangsúlyozta, hogy a desztilláció korlátozása hátráltathatja az AI fejlődését.

Forrás

Feldolgozott sajtóforrás·Wired

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom