ÉlőUtoljára: 6 perceMa: 15
Üzlet & Startupfrissítve: 07:16

Új modellfrissítési módszert vezet be a Dedicated Model Inference, leállás nélkül

Az új rendszer lépésenként váltja a forgalmat, és automatikusan visszafordítja a frissítést, ha a teljesítmény romlik, mint ahogy a Qwen2.5-7B frissítése Qwen3.5-9B-re példázza.

Új modellfrissítési módszert vezet be a Dedicated Model Inference, leállás nélkül
Fotó: Stephen Dawson / Unsplash
forrás: Together AI·AI Forradalom szerk.·
Megosztás

A Dedicated Model Inference új, „bevezetés” nevű funkciója lehetővé teszi az AI-modellek leállás nélküli frissítését. A rendszer a forgalmat fokozatosan tereli át az új modellre, miközben folyamatosan figyeli a teljesítményt. (Together AI)

A hagyományos módszerek, mint a „hard swap” (azonnali csere) vagy a manuális forgalomátterelés, kockázatosak: egy hiba esetén azonnal minden felhasználót érint a probléma, és a visszavonás is nyomás alatt történik. Az új rendszer ezt hivatott kiküszöbölni.

Hogyan működik a bevezetés?

A rendszer három fő stratégiát támogat: a „Canary”-t, a „Blue-green”-t és a „Rolling”-ot. A „Canary” módszer esetén a forgalom meghatározott százalékokban (például 5%-ról indulva, majd 25%, 50%, végül 100%-ra növelve) kerül átterelésre. Minden lépés után várakozási idő és opcionális metrikus kapuk (például p95 latencia vagy hibaszázalék) futnak le.

Ha egy metrikus kapu hibát észlel — mint például a Qwen2.5-7B modell Qwen3.5-9B-re való frissítésekor tapasztalt 137%-os p95 latencianövekedés 10%-os forgalomnál —, a folyamat megáll, és a rendszer automatikusan visszafordítja a változtatásokat, anélkül, hogy a felhasználói kérések megszakadnának.

Stratégiák és lépések

A „Blue-green” stratégia egyetlen, 0%-ról 100%-ra történő átkapcsolás, míg a „Rolling” módszer replika-szinten cseréli a modelleket, megőrizve a teljes kapacitást. Minden „Canary” lépés során a cél-replikák először felfutnak, majd a rendszer futtatja az állapotellenőrzéseket, mielőtt a forgalom átterelődne. A forgalom átirányítása után az eredeti modell kapacitása csökken.

A folyamatokat az API-n vagy CLI-n keresztül lehet létrehozni és indítani, akár előzetes áttekintésre „PENDING” állapotban tartva. A rendszer automatikusan leállítja a folyamatot hiba esetén („SYSTEM_PAUSED”), és csak emberi jóváhagyás után folytatható, vagy törölhető.

A Qwen2.5-7B modell Qwen3.5-9B-re történő frissítésének példájában a rendszer sikeresen elkapta a latencia-regressziót, és a hibás frissítést visszavonta, miközben a felhasználók továbbra is kiszolgálásra kerültek. A Dedicated Model Inference 2026. szeptember 22-én tette közzé a funkció részleteit.

Forrás

Feldolgozott sajtóforrás·Together AI

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom