Az NVIDIA új alapja gyorsítja a GPU-s hálózatkezelést
Az NVIDIA DOCA GPUNetIO keretrendszere lehetővé teszi a CUDA kernel-ek számára, hogy közvetlenül vezéreljék a hálózati műveleteket, miközben a CPU-t kivonja a kritikus útvonalból.

Az NVIDIA bemutatta a DOCA GPUNetIO-t, egy új hálózatkezelési alapréteget, amely a GPU-vezérelt számítási műveleteket helyezi előtérbe. A GPU-alkalmazások egyre inkább igénylik, hogy a hálózati és adatmozgatási feladatok első osztályú, GPU-vezérelt műveletekként viselkedjenek, ne pedig gazdavezérelt szolgáltatásokként. Amikor a CPU minden hálózati tranzakció közepén helyezkedik el, az üzenetkésleltetést és a valós idejű válaszadási képességeket korlátozza. (Nvidia Developer)
A DOCA GPUNetIO egységes GDA-KI (GPUDirect Async Kernel-Initiated) alapot biztosít, amely lehetővé teszi a CUDA kernel-ek számára, hogy közvetlenül hajtsák végre az Ethernet, RDMA, Verbs és DMA műveleteket, miközben a CPU-t kivonja az alkalmazás kritikus útvonalából. A keretrendszer a DOCA SDK részeként, valamint egy könnyebb, nyílt forráskódú, Verbs-központú implementációként is elérhető.
Az NVIDIA szerint a GPUNetIO-ra épülő közös alap előnye, hogy ahelyett, hogy minden kommunikációs könyvtár saját különálló GDA-KI implementációt tartana karban, egyetlen közös alapra konvergálhatnak. Ez csökkenti a mérnöki erőfeszítések duplikálását és gyorsítja az innovációk elérhetővé válását más keretrendszerek számára. Az NVSHMEM 3.7 például egy GPUNetIO-alapú transportot vezetett be, amely csökkenti az implementáció összetettségét, miközben megőrzi a teljesítményt.
A DOCA GPUNetIO két formában érhető el: a teljes DOCA SDK verzió, amely szélesebb körű képességeket kínál, és egy nyílt forráskódú projekt, amely egy könnyebb, RDMA-Verbs-központú implementáció. Az nyílt forráskódú verzió képes felismerni a DOCA SDK jelenlétét futásidőben, és ha rendelkezésre áll, dlopen-en keresztül hívhat meg kiválasztott zárt forráskódú DOCA SDK funkciókat.
Az NVQLink a GPUNetIO-alapú GPU RoCE Transceiver operátort használja, hogy körülbelül 2,6 mikroszekundumos minimális körutazási késleltetést érjen el kvantum-klasszikus munkafolyamatokhoz IGX Thor rendszeren, Blackwell GPU-val és ConnectX-7-tel. Az NVIDIA belső tesztjei szerint ez az érték jobb CTA és QP skálázódást tesz lehetővé kis üzenetméretek esetén.
A keretrendszer integrálódott olyan kommunikációs könyvtárakkal, mint az NCCL (2.27-es verzió óta használja a GPUNetIO Verbs backendet), az NVSHMEM (3.7-es verzió), az UCX/NIXL, a Holoscan Sensor Bridge és az NVQLink. Az NVIDIA Nemotron által támogatott fejlesztés célja a GPU-vezérelt hálózatkezelés egyszerűsítése és teljesítményének növelése.