GPUThor-támadás áttöri az Nvidia GPU-k hibajavítását, root shell érhető el
A GPUThor nevű Rowhammer-támadás áttöri az Nvidia GPU-k ECC-védelmét, így egy átlagos CUDA-programból root shell nyerhető a gazdaszámítógépen, mindössze 1,1 perc alatt.

A Torontói Egyetem kutatói megmutatták, hogy a Rowhammer-támadás, ha erősebben célozzák, képes áthatolni az Nvidia GPU-k hibajavításán (ECC). A GPUThor nevű technika az Nvidia négy Ampere-generációs kártyáján — RTX A4000, A4500, A5000 és A6000 — működik, és egy egyszerű, nem kiváltságos CUDA-programból root shellel rendelkezhet a gazdaszámítógépen, még akkor is, ha az ECC engedélyezve van. (TNW)
Chris S. Lin, Joyce Qu, Aditya Rajeev és Gururaj Saileshwar 2024. augusztus 25-én publikálták tanulmányukat, amelyet novemberben mutatnak be az ACM CCS konferencián. Az Nvidia augusztus 21-én adott ki biztonsági figyelmeztetést, a támadókód pedig november 15-ig privát marad. A kutatók szerint nincs szoftverfolt, és új hardver nélkül nem is lehet.
A Rowhammer mechanizmusa és az ECC válasza
A DRAM biteket töltésként tárolja cellákban, amelyek szorosan egymás mellett helyezkednek el. Egy sor ismételt olvasása töltés szivárgását okozhat a szomszédos cellákba, megváltoztatva azok bitjeit. Ez a támadási forma már egy évtizede kedvelt módja a homokozóból való kitörésnek és a jogosultság-emelésnek CPU-kon. A GPU-kra korábban a GPUHammer (2025) és a GPUBreach (idén) hozta el a bitflipeket, de ezek a támadások azonnal meghibásodtak, amint az ECC-t bekapcsolták. Az ECC képes volt javítani az egyetlen bitet érintő hibákat, és észlelni a másodikat.
GPUThor: Az erősebb támadás
A GPUThor eltér a korábbi GPU-támadásoktól, mivel erősebben „kalapálja” a memóriát. Míg a korábbi GPU-támadások egységesen támadtak, a GPUThor nem-egységes mintázatokat használ, kihasználva, hogy a GPU memóriarendszere a különböző warp-okból érkező, különböző cache sorokra irányuló hozzáféréseket különálló találatokként kezel. Emellett az Ampere GDDR6 memóriáján a Target Row Refresh nagyjából 72 frissítési intervallumonként történik, nem pedig intervallumonként, mint korábban feltételezték.
Ez 6,6-szoros kalapálási intenzitást és 500–23 500-szor több bitflitet eredményez, mint a korábbi GPU-támadásoknál. Az ECC bekapcsolása mellett is érkeznek hibák, amelyeket a védelem nem tud kezelni: a kutatók 387 dupla-bit hibát észleltek, amelyeket az ECC csak észlelni tudott, de javítani nem, valamint két tripla-bit hibát, amelyeket az ECC tévesen javított.
Háromféle támadási lehetőség
Az első a szolgáltatásmegtagadás (denial of service): egy A6000 kártyán az ECC bekapcsolt állapotában a GPUThor körülbelül 2 óránként kényszerít egy GPU-resetet, ami minden feladatot leállít az adott kártyán. A második a rendszerátvétel (takeover): a GPU lapozótábláinak manipulálásával egy nem kiváltságos program képes olvasási és írási hozzáférést szerezni bármely memóriához, és root shellel rendelkezni a gazdaszámítógépen.
A harmadik a néma adatrombolás (silent corruption): egy tripla-bit hiba, amelyet az ECC tévesen javít, nem hagy nyomot. Ez különösen veszélyes lehet AI-modellek betanítása vagy kiszolgálása során, mivel a modell súlyai hibásan módosulhatnak.
Kiknek kell aggódniuk?
A megerősített kártyák munkaállomás-alkatrészek, gyakoriak az AI-munkaállomásokban és a felhőpéldányokban. Bár Nvidia szerint a GDDR6X vagy HBM2e kártyákon nem jelentkeztek bitflimek, a BleepingComputer jelentése szerint a tanulmány megemlíti, hogy a jogosultság-emelés működhet az A100 szerver GPU-kon is, amelyek ugyanolyan hibajavítási osztályt használnak.
A Blackwell új hardveres javításai lassítják, de nem állítják meg a támadást. A megosztott GPU-k jelentenek különösen nagy kockázatot, mivel egy bérlő támadhatja a vele azonos fizikai kártyán futó más felhasználókat. Ez a felhőalapú AI-szolgáltatások gazdaságosságával szemben hat, ahol a megosztott GPU-idő értékesítése a bevételi forrás.
Mit figyeljünk?
Három dologra érdemes figyelni: november 15-re, amikor a kód nyilvánossá válik; az A100 szerver GPU-k kérdésére, amelyek érintettsége nagyságrendekkel nagyobb flottát jelentene; valamint a javítás hiányára. A kutatók szerint a teljes megoldáshoz új hardverre, például multi-bit ECC-re vagy a DDR5-ös memóriákban található Refresh Management és Per-Row Activation Counting funkciókra lenne szükség, amelyek a jövő termékei. A jelenleg telepített rendszerek továbbra is a tavalyi Nvidia-mitigációval futnak, amelyet a GPUThor áttör.