Bemutatta a CUDA 13.4-et az NVIDIA, Windows on Armra is működik
A CUDA Toolkit 13.4 már támogatja a Windows on Arm rendszereket, így a fejlesztők Linuxon túl is használhatják az NVIDIA GPU-kat. Az új kiadás előzetes támogatást nyújt az NVIDIA Rubin architektúrához (compute capability 107) is.

Az NVIDIA bejelentette a CUDA Toolkit 13.4 kiadását, amely számos új funkcióval és fejlesztéssel bővíti a GPU-fejlesztési ökoszisztémát. A frissítés egyik legfontosabb újdonsága a Windows on Arm platform támogatása, ami kiterjeszti a CUDA alkalmazások fejlesztési lehetőségeit a korábban Linuxra korlátozott Arm rendszerekre — közölte az NVIDIA Developer Blog.
Rubin architektúra előzetes támogatása
A CUDA Toolkit 13.4 funkcionális előzetes támogatást nyújt az NVIDIA Rubin GPU architektúrához (compute capability 107). Ez lehetővé teszi a fejlesztők számára, hogy még az általános elérhetőség előtt elkezdjék alkalmazásaik átportolását az új generációs GPU-ra, amely az úgynevezett „agentic AI” korszakát hivatott meghajtani.
Fejlettebb GPU-erőforrás-kezelés
A Multi-Process Service V3 (MPS V3) modernizált vezérlőréteget vezet be a CUDA MPS-hez, leegyszerűsítve a megosztott GPU-erőforrások automatizálását és kezelését. Az új verzió szkriptelhető parancssori felületet (CLI), elnevezett szerverpéldányokat, TOML konfigurációt és cgroup-integrált GPU memóriakorlátokat kínál a konténerizált környezetekben történő precíz GPU-particionáláshoz. Ez maximalizálja a hardverkihasználást, miközben szigorú erőforrás-izolációt biztosít minden folyamat számára.
CUDA Python és CCCL fejlesztések
A CUDA Python cuda.core 1.1.0 verziója bővült textúra- és felületprogramozással, NUMA-tudatos felügyelt memóriával és .pyi típusú stubokkal. A cuda.compute 1.1 pedig lehetővé teszi az ahead-of-time fordítást több GPU architektúra számára. A CCCL 3.4 gyorsabb warp-specializált cub::DeviceScan-t kínál Blackwell GPU-kon, akár 92%-os memória-sávszélesség-kihasználtságot érve el, valamint új, egyszólamú API-kat, kötegelt warp-redukciókat és C++ Standard Library párhuzamos algoritmusokat ad a cuda::std-hez.
CUDA Compute Fabric Transport
Az új CUDA Compute Fabric Transport (CFT) API-t kínál kommunikációs könyvtárak számára az adatok NVLink fabricon keresztüli mozgatásához. Ez az API logikai végpontokat és aszinkron műveleteket használ, csökkentve a virtuális címterhelést nagyméretű, több GPU-s rendszerekben. A CFT elsősorban kommunikációs könyvtárfejlesztőknek szól, akiknek speciális funkciókra van szükségük.
További fejlesztések és elérhetőség
A CUDA Toolkit 13.4 emellett programozható hozzáférést biztosít a lokalitási tartományokhoz, ami javíthatja a teljesítményt a több lokalitási tartománnyal rendelkező eszközökön. Támogatja az unified memory rezidenciainformációinak lekérdezését is, ami a teljesítményérzékeny könyvtáraknak segít optimalizálni az adatmozgatást. A CUDA SDK telepítői már nem tartalmazzák az NVIDIA drivert; az nvidia-open driver vagy a cuda-toolkit csomagokat külön kell telepíteni. A Rubin architektúra támogatása a jövőbeli CUDA Toolkit kiadásokban válik általánosan elérhetővé.