ÉlőUtoljára: 10 perceMa: 34
Hardver & Infrafrissítve: 21:25

Az NVIDIA útmutatót ad az AI-infrastruktúra teljes körű figyeléséhez

Az útmutató egy hat órás, csökkentett átviteli sebességű elosztott képzési feladatot mutat be példaként, ahol egyetlen InfiniBand-kapcsolat emelkedő bitsebesség-hibája okozta a lassulást.

Az NVIDIA útmutatót ad az AI-infrastruktúra teljes körű figyeléséhez
Fotó: Brecht Corbeel / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

Az AI-infrastruktúra megfigyelése összetett feladat, amely a számítási és hálózati rétegektől a tároláson, az orchestráción és az alkalmazásokon át terjed. Amikor a teljesítmény csökken, a probléma forrásának azonosítása nehézkes lehet, mivel egy rétegen megfigyelt tünet máshol eredhet a rendszerben. A teljes körű megfigyelési stratégia összekapcsolja a telemetriát ezeken a rétegeken keresztül, segítve az infrastruktúra- és üzemeltetési csapatokat a problémák észlelésében, okainak feltárásában, valamint a megbízható AI-munkaterhelések fenntartásában. (Nvidia Developer)

Az AI-képzés az úgynevezett bulk synchronous parallel (BSP) modellt követi, amely érzékeny a lemaradókra; az egyetlen lassú egység visszatartja az egész feladatot. Ez a cikk egy gyakorlati megfigyelési keretrendszert mutat be az NVIDIA AI-infrastruktúra számára, és bemutatja, hogyan alkalmazható a gyakori monitorozási és hibaelhárítási forgatókönyvekre.

Az AI-gyárak megfigyelési területeinek azonosítása

Mielőtt bármilyen felügyeleti szoftvert kiválasztanánk, fel kell sorolni azokat a területeket, ahol a csendes hibák elpazarolhatják a GPU-órákat. Ide tartozik az alapvető platformegészség (ventilátorok, tápegységek, BMC, ház, CPU, memória, helyi tároló), a GPU-egészség és -teljesítmény (kihasználtság, hőmérséklet, energia, XID/ECC, NVLink átviteli sebesség), a hálózat integritása (InfiniBand vagy Ethernet kapcsolatok, torlódás, kapcsoló/kábel állapota), a fürt és a feladatok állapota (ütemezés, foglalások, tétlen GPU-k, várakozási idők), valamint az inferenciaszolgáltatások (késleltetés, sikerességi arány, gyorsítótár viselkedése).

Alkatrészek és telemetriai eszközök összekapcsolása

A műveleti csapatoknak világos leképezésre van szükségük az alkatrészek és a telemetriai források között. Az NVIDIA Data Center GPU Manager (DCGM), az NVIDIA System Management (NVSM), az NVIDIA Unified Fabric Manager (UFM), az NVIDIA NetQ, az NVIDIA NMX, az NVIDIA Base Command Manager (BCM) és az NVIDIA Run:ai eszközkészletet kínál az infrastruktúra összetevőihez. A cél a minimális eszközátfedés és a tömör, cselekvőképes riasztási készletek fenntartása, amelyek közvetlenül a SLO/SLI metrikákhoz kapcsolódnak, egységesített hibaelhárítási irányítópultokkal a Prometheus/Grafana rendszerben.

A kulcsfontosságú döntések közé tartozik a DCGM és az NVSM közötti választás GPU-k esetében, ahol a DCGM előnyös a kihasználtság és más metrikák Prometheusba exportálása szempontjából, míg az NVSM a DGX-osztályú csomópontok rendszerállapotát kezeli. Az UFM az InfiniBand, a NetQ pedig a Spectrum Ethernet/RoCE hálózatokhoz ajánlott. Az NMX a rack-méretű NVLinkhez szükséges, míg a BCM-et az aggregátor és a fürt/feladat síkként kell kezelni.

A Run:ai és az NIM akkor vezethetők be, ha a munkaterhelés ütemezési méltányossága vagy az inferencia SLO-k elsődleges üzemeltetési követelmények. Az alapvető szabály: minden szükséges zöld cellát a lehető legkevesebb eszközzel fedjünk le. A felesleges exportálók zajt adnak, nem megfigyelhetőséget, ami riasztási fáradtsághoz vezethet. Az NVIDIA DGX és az NVIDIA HGX telepítések ugyanazt a megfigyelési felületet osztják meg, még akkor is, ha a hardverkonfigurációk eltérnek.

Az üzemeltetési legjobb gyakorlatok közé tartozik, hogy minden felügyelt tartománynak legalább egy dedikált eszközzel kell rendelkeznie, minden kritikus riasztásnak cselekvőképesnek és hozzárendeltnek kell lennie. A megfigyelhetőség érettségét a hibás komponensek azonosításának képessége méri, mielőtt jelentős számítási erőforrás-veszteség következne be, amelyet az NVIDIA Base Command Manager (BCM) és a kapcsolódó eszközök támogatnak.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom