Új modellfrissítési módszert vezet be a Dedicated Model Inference, leállás nélkül
Az új rendszer lépésenként váltja a forgalmat, és automatikusan visszafordítja a frissítést, ha a teljesítmény romlik, mint ahogy a Qwen2.5-7B frissítése Qwen3.5-9B-re példázza.

A Dedicated Model Inference új, „bevezetés” nevű funkciója lehetővé teszi az AI-modellek leállás nélküli frissítését. A rendszer a forgalmat fokozatosan tereli át az új modellre, miközben folyamatosan figyeli a teljesítményt. (Together AI)
A hagyományos módszerek, mint a „hard swap” (azonnali csere) vagy a manuális forgalomátterelés, kockázatosak: egy hiba esetén azonnal minden felhasználót érint a probléma, és a visszavonás is nyomás alatt történik. Az új rendszer ezt hivatott kiküszöbölni.
Hogyan működik a bevezetés?
A rendszer három fő stratégiát támogat: a „Canary”-t, a „Blue-green”-t és a „Rolling”-ot. A „Canary” módszer esetén a forgalom meghatározott százalékokban (például 5%-ról indulva, majd 25%, 50%, végül 100%-ra növelve) kerül átterelésre. Minden lépés után várakozási idő és opcionális metrikus kapuk (például p95 latencia vagy hibaszázalék) futnak le.
Ha egy metrikus kapu hibát észlel — mint például a Qwen2.5-7B modell Qwen3.5-9B-re való frissítésekor tapasztalt 137%-os p95 latencianövekedés 10%-os forgalomnál —, a folyamat megáll, és a rendszer automatikusan visszafordítja a változtatásokat, anélkül, hogy a felhasználói kérések megszakadnának.
Stratégiák és lépések
A „Blue-green” stratégia egyetlen, 0%-ról 100%-ra történő átkapcsolás, míg a „Rolling” módszer replika-szinten cseréli a modelleket, megőrizve a teljes kapacitást. Minden „Canary” lépés során a cél-replikák először felfutnak, majd a rendszer futtatja az állapotellenőrzéseket, mielőtt a forgalom átterelődne. A forgalom átirányítása után az eredeti modell kapacitása csökken.
A folyamatokat az API-n vagy CLI-n keresztül lehet létrehozni és indítani, akár előzetes áttekintésre „PENDING” állapotban tartva. A rendszer automatikusan leállítja a folyamatot hiba esetén („SYSTEM_PAUSED”), és csak emberi jóváhagyás után folytatható, vagy törölhető.
A Qwen2.5-7B modell Qwen3.5-9B-re történő frissítésének példájában a rendszer sikeresen elkapta a latencia-regressziót, és a hibás frissítést visszavonta, miközben a felhasználók továbbra is kiszolgálásra kerültek. A Dedicated Model Inference 2026. szeptember 22-én tette közzé a funkció részleteit.