Mire elég a 99%? Így épül fel az AI-inference megbízhatósága
Az AI-inference szolgáltatók 99%, 99,9% és 99,99% rendelkezésre állást ígérnek. De mit jelentenek ezek a számok, és milyen infrastruktúrát igényelnek?

Az AI-inference szolgáltatók könnyen publikálhatnak megbízhatósági számokat, de ezek mögötti valóság sokkal bonyolultabb. A 99%-os, 99,9%-os és 99,99%-os rendelkezésre állás elérése eltérő infrastruktúrát és folyamatokat igényel, melyek mindegyike specifikus hibatípusok túlélésére épül. (Together AI)
A GPU-inference rendszerek eltérően hibásodnak, mint a hagyományos CPU-alapú szolgáltatások. A nagy teljesítményre optimalizált rendszerek, mint az egymillió token/perc/GPU vagy a 200 TPS (tranzakció/másodperc) elérése, kevés mozgásteret hagynak a hibaelhárításra. A megbízhatóság növelése exponenciálisan nehezebb minden egyes „kilences” hozzáadásával.
Kapcsolódó: AI-projektek sikere
A hibadomének rétegei
Az inference rendszereket négy fő hibadomén érintheti: a számítási kapacitás (compute), a hálózat (network), a tárhely (storage) és a szoftver (software). A GPU-k esetében gyakoriak a VRAM ECC hibák, termikus túlterhelés, driver-összeomlások vagy NVLink-hibák. A hálózatban kapcsoló- vagy adóvevő-hibák, míg a tárhelyen súlyosbítások merülhetnek fel. A szoftveres hibák routing-problémákból vagy üzembe helyezési hibákból eredhetnek.
Kapcsolódó: Gemini API költségcsökkentés
99%: Node-szintű hibák túlélése
A 99%-os rendelkezésre állás azt jelenti, hogy az architektúra képes túlélni a node-szintű hibákat, mint a GPU hardverhibák vagy driver-összeomlások. Ehhez automatizált állapotellenőrzésre, node-kiszolgálásra és gyors replikacserére van szükség egyetlen adatközponton belül. A kihívás az, hogy a magas kihasználtság mellett ne sérüljön a megbízhatóság.
Kapcsolódó: LLM pontosság javítása
99,9%: Teljes adatközpont-kiesés elleni védelem
A 99,9%-os szint eléréséhez a teljes adatközpont kiesését kell túlélni. Ez általában azt jelenti, hogy a modell súlyai két létesítményben vannak telepítve, elegendő kapacitással mindkét oldalon a teljes terhelés elnyelésére, és az élő forgalom mindkettőre irányul. Az infrastruktúra tulajdonlása itt kulcsfontosságú: a saját infrastruktúrával rendelkező szolgáltatók gyorsabban reagálhatnak, mint azok, akik csak bérelnek.
Kapcsolódó: AI modellek tudásmunka
99,99%: Regionális kimaradás túlélése
A legmagasabb, 99,99%-os szinthez multi-regionális telepítésre van szükség AZ (Availability Zone) redundanciával és dedikált tartalék kapacitással a kiesés régióban. Ez azt jelenti, hogy nem csak át tudják irányítani a forgalmat, hanem aktívan rendelkeznek szabad kapacitással az átirányításhoz. A GPU-k magasabb meghibásodási aránya miatt ez a szint különösen nagy mérnöki kihívást jelent.
Kapcsolódó: LLM méret becslése
Mit kérdezzünk az AI-szolgáltatótól?
Az SLA-k (Service Level Agreement) csak a kezdetet jelentik. Fontos megkérdezni a modell-hosting helyét, az infrastruktúra tulajdonjogát, a felelősségi köröket adatközpont-kiesés esetén, a hibaelhárítás sebességét és a tartalék kapacitás meglétét. A teljeskörű szakértelem, a chip-től a token-ig tartó láthatóság és a valós tesztekkel ellenőrzött failover-mechanizmusok elengedhetetlenek a valódi megbízhatósághoz.