ÉlőUtoljára: 27 perceMa: 2
Üzlet & Startupfrissítve: 11:19

Kapacitás-tudatos útválasztást vezet be a Together AI új AI-architektúrájában

A Dedicated Model Inference három részből áll: végpont, telepítés és konfig. A kapacitás-tudatos útválasztás arányosan osztja el a forgalmat a futó replikák és a súlyozás alapján.

Kapacitás-tudatos útválasztást vezet be a Together AI új AI-architektúrájában
Fotó: Lightsaber Collection / Unsplash
forrás: Together AI·AI Forradalom szerk.·
Megosztás

A Together AI új architektúrája, a Dedicated Model Inference (DMI) három fő komponensre épül: végpont, telepítés és konfig. Ezek együttműködését a kapacitás-tudatos útválasztás teszi lehetővé, ami alapvető az olyan funkciókhoz, mint a leállás nélküli frissítések, A/B tesztek és shadow experimentek.

Erőforrásszerkezet és immutabilitás

A DMI három fő erőforrásból áll: a végpont egy stabil név, amelyet az alkalmazások az API-hívásokhoz használnak. A telepítés egy adott modellverziót és hardverkonfigurációt köt össze, és futtatja a replikákat. A konfig egy „recept”, amely meghatározza a modell futtatásának paramétereit, mint például a GPU típusa, a párhuzamosság és az optimalizációs profil (throughput, latency, balanced). A konfigok immutábilisak, azaz nem változtathatók meg egy már létező példányban; minden módosítás új revíziót eredményez.

Egy új telepítés nem kap forgalmat, amíg a végpont forgalmi megosztásában nem szerepel. A CLI `together beta endpoints deploy` parancsa automatikusan beállítja ezt a megosztást, megkönnyítve a gyors üzembe helyezést. A `routing_error` hiba általában akkor fordul elő, ha a forgalmi megosztás nincs megfelelően konfigurálva. A konfigurációk immutabilitása biztosítja, hogy egy telepítés viselkedése ne változhasson váratlanul, mivel minden módosítás új revíziót hoz létre, amely egy megbízható visszavonási célpontként szolgál.

Útválasztási logika és tesztelési módszerek

A kapacitás-tudatos útválasztás a forgalmat a replikák száma és az egyes deployokhoz rendelt súly (weight) szorzata alapján osztja el. Például, ha két telepítés azonos súlyt kap (pl. 1), de az egyiknek 1, míg a másiknak 3 futó replikája van, a forgalom nem 50%-50%, hanem 25%-75% arányban oszlik meg. Ez a megközelítés biztosítja, hogy az egyes replikák terhelése egyenlő maradjon, függetlenül a replikák számától. Az autoscaling automatikusan alkalmazkodik ehhez a logikához: ha egy telepítés replikái számban nőnek, kapacitása is arányosan növekszik, és több forgalmat kap.

Az architektúra támogatja a bevezetés-okat, A/B teszteket és shadow experiment-okat. A rolloutok lehetővé teszik az új modellek vagy konfigok fokozatos bevezetését. Az A/B tesztek lehetővé teszik a különböző verziók párhuzamos futtatását és forgalom-szétosztását, míg a shadow experimentekben egy telepítés súlya 0-ra állítható, így tükrözött forgalmat kap anélkül, hogy ténylegesen kiszolgálná a kéréseket. Egy telepítés leállítása a min és max replikák 0/0-ra állításával történik.

A Together AI a modellekhez előre definiált, tanúsított telepítés profilokat kínál, amelyek tartalmazzák a modell és a konfig erőforrásneveit. Ezek a profilok segítenek a felhasználóknak a megfelelő hardver és optimalizációs beállítások kiválasztásában. Az optimalizációs tengelyek (latency, throughput, balanced) a futási paraméterek finomhangolására szolgálnak, interaktív chat-alkalmazásokhoz a latency, míg batch feldolgozáshoz a throughput ajánlott.

Forrás

Feldolgozott sajtóforrás·Together AI

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom