Titkosított GPU-kkal gyorsítaná az AI-t az NVIDIA, 98%-os teljesítményt ígér
Az NVIDIA titkosított GPU-i és a TensorRT LLM együttesen teszik lehetővé a nagy teljesítményű, privát AI-inferenciát titkosított környezetben, minimális sebességveszteséggel. A DeepSeek-R1 modellen végzett tesztek 96,1–98,2%-os átviteli sebességet mutattak.

Az NVIDIA bemutatta a titkosított AI-inferencia új generációját a Confidential Computing (CC) technológiával. Ez lehetővé teszi a bizalmas adatok feldolgozását memóriával titkosított virtuális gépeken, titkosított GPU-kon és titkosított NVLink-en keresztül. A cél a legérzékenyebb AI-munkafolyamatok — mint a személyes, vállalati vagy szabályozott környezetben futó LLM-inferenciák — biztonságos futtatása megbízható hardveren. (Nvidia Developer)
Az új megoldás a TensorRT LLM keretrendszerrel együttműködve igyekszik megőrizni a magas teljesítményt. A titkosított környezetben futó AI-inferencia ugyanis megváltoztatja a memóriakezelés, az időzítés és a több GPU-s kommunikáció alapvető feltételezéseit. Ezek a változások teljesítménycsökkenést okozhatnak, ha a futtatókörnyezet nem alkalmazkodik hozzájuk. Az NVIDIA Blackwell GPU-kra optimalizált TensorRT LLM olyan CC-specifikus módosításokat tartalmaz, amelyek minimalizálják ezt a hatást.
Titkosított adatáramlás és kernel-optimalizálás
Az NVIDIA B200 titkosított környezetében a host-to-device átvitel egy titkosított „bounce buffer”-en halad át. Ezért a TensorRT LLM az eddigi „pinned memory” helyett „pageable memory”-t használ, és az ismétlődő token-olvasást aszinkron workerre helyezi. Ez megakadályozza, hogy a titkosított másolási műveletek blokkolják a fő szálat. A kernel autotuner a korábbi CUDA-események helyett a GPU %globaltimer-ét használja az időméréshez, stabilabb eredményeket biztosítva.
Teljesítménytesztek és eredmények
A DeepSeek-R1 modellen, nyolc NVIDIA B200 GPU-n végzett tesztek szerint a titkosított számítási környezet a baseline-hoz képest 96,1–98,2%-os átviteli sebességet tartott meg. A tokenenkénti késleltetés mindössze 1,2–4,3%-kal nőtt az 1–16 közötti konkorrencia-szinteken. Az NVLS multicast azonban nem elérhető a B200 titkosított konfigurációiban, ezért a keretrendszereknek felismerniük kell az NVLS elérhetőségét, és ennek megfelelően kell kiválasztaniuk a kommunikációs algoritmusokat.
Az NVIDIA a fejlesztőket arra biztatja, hogy tekintsék át a Trusted Computing dokumentációt, és ismerkedjenek meg a TensorRT LLM legújabb funkcióival a titkosított inferencia bevezetéséhez. Az NVIDIA Confidential Compute híreinek követése is javasolt a további fejlesztésekről való tájékozódáshoz.