ÉlőUtoljára: 7 perceMa: 2
Hardver & Infrafrissítve: 01:16

Új eszközt adott ki az AI-infrastruktúra optimalizálására az NVIDIA

Az NVIDIA Topograph eszköze automatikusan feltérképezi az AI-infrastruktúra topológiáját, és optimalizálja a munkafolyamatok elhelyezését a hatékonyabb számítási teljesítmény érdekében.

Új eszközt adott ki az AI-infrastruktúra optimalizálására az NVIDIA
Fotó: Brecht Corbeel / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

Az NVIDIA bemutatta a Topograph nevű új nyílt forráskódú eszközt, amely az AI-gyárak infrastruktúrájának topológiáját térképezi fel. Az eszköz célja, hogy segítse a munkafolyamat-kezelőket a GPU-munkafolyamatok legoptimálisabb elhelyezésében, elkerülve a teljesítményt csökkentő topológiai töredezettséget. A Topograph folyamatosan frissíti a topológiai nézetet, így a rendszerek naprakészek maradnak manuális beavatkozás nélkül – írja az NVIDIA Developer Blog.

A rosszul elhelyezett munkafolyamatok csökkenthetik a hálózati átvitelt, növelhetik a feladatok költségeit és a GPU-k kihasználatlanul hagyhatják a rendelkezésre álló kapacitást. Mivel a GPU-k folyamatosan cserélnek adatokat a betanítás és az inferencia során, a kommunikációs lokalitás kulcsfontosságú a nagy teljesítményű elosztott munkafolyamatok számára. Az NVIDIA NVLink és NVLink Switch nagy sávszélességű, minden-mindenhez csatlakozást biztosít a rack-méretű GPU-tartományokon belül, míg az NVIDIA Spectrum-X Ethernet alacsony késleltetésű hálózatot kínál rendszerek és rack-ek között.

Topológiai problémák és megoldások

A hatékony ütemezéshez a rendszergazdáknak naprakész és pontos képre van szükségük a GPU-k és a hálózat kapcsolatáról. A Topograph ezt a problémát oldja meg azáltal, hogy felfedezi a fürt topológiáját felhő API-kon vagy on-premises rendszereken keresztül, egységes modellbe normalizálja, majd közzéteszi azt az elvárt formátumban: Kubernetes csomópont címkékként, Slurm konfigurációként vagy Slinky ConfigMap-ként.

A Topograph az NVIDIA DSX OS (Data Science Experience Operating System) fürtvezérlési rétegén belül működik együtt a Dynamic Resource Allocation (DRA) és a KAI Scheduler eszközökkel, lehetővé téve a topológia-tudatos „gang scheduling”-et az AI-gyárak infrastruktúráján keresztül. Ez a megközelítés biztosítja, hogy a szorosan összekapcsolt munkafolyamatok a lehető legrövidebb, legnagyobb sávszélességű útvonalakon futhassanak.

Támogatott környezetek és funkciók

A Topograph az NVIDIA Quantum InfiniBand portok akár 800 Gb/s sebességét, valamint az NVIDIA NVLink 1.8 TB/s (ötödik generáció, NVIDIA Blackwell, pl. GB200/GB300) és 3.6 TB/s (hatodik generáció, Vera Rubin) sebességét is kihasználja.

Az eszköz támogatja a Google Cloud, Lambda, Nebius, Nscale és Oracle Cloud Infrastructure (OCI) felhőszolgáltatókat, valamint on-premises környezetben az InfiniBand, Spectrum-X és Multi-Node NVLink (MNNVL) tartományokat. A felhasználók a Topograph-ot Helm segítségével telepíthetik Kubernetes-re, vagy natív csomagként Slurm-fürtökre, tesztelési célokra pedig szimulációs segédprogramok is rendelkezésre állnak.

A Topograph folyamatosan regenerálja a topológiai nézetet, amikor a fürt változik, így az ütemezők mindig naprakész adatokkal dolgoznak. Az eszköz a [dsx-ai-factory/topograph GitHub repóban](https://github.com/dsx-ai-factory/topograph) érhető el, és az NVIDIA Nemotron által működtetett AI-gyárak optimalizálását célozza.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom