ÉlőUtoljára: 6 perceMa: 9
Üzlet & Startupfrissítve: 06:15

Prime Intellect új szerver nélküli AI-platformja az OpenAI-val kompatibilis

A Prime Inference szerver nélküli és dedikált kapacitást kínál nyílt AI-modellekhez, OpenAI-kompatibilis API-val és NVIDIA Blackwell GPU-kkal.

Prime Intellect új szerver nélküli AI-platformja az OpenAI-val kompatibilis
Fotó: Christian Wiediger / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A Prime Inference a Prime Intellect nyílt betanítási infrastruktúrájának kiszolgálórétege. A cég már korábban is kínált utófeldolgozási eszközöket, mint például prime-rl, verifikátorok és homokozók. A kiszolgálóréteg lezárja a kört: a bevezetett modellek termelési nyomokat generálnak, amelyek visszavezethetők a betanításba. A Prime Intellect szerint a GLM-5.3 végpontja az OpenRouter egyik leggyorsabbjaként szerepel, emellett közel nulla hibaszázalékkal működik a funkcióhívások során, és 100%-os rendelkezésre állást mutatott a bevezetés óta. (MarkTechPost)

Üzemmódok és kompatibilitás

A platform két fő üzemmódot kínál: szerver nélküli végpontokat a változó igényekhez, és dedikált kapacitást a folyamatos munkaterheléshez. Az OpenAI-kompatibilitás lehetővé teszi, hogy bármely OpenAI SDK-t az api.pinference.ai/api/v1 végponthoz irányítsanak. Az automatikus meghibásodás-átkapcsolás (failover) az adatközpontok között az épp működő telepítésekre irányítja a forgalmat. A rendszert NVIDIA Blackwell GPU-kon futtatják, és a Vera Rubin GPU-k támogatása is szerepel a terveik között.

Infrastrukturális technológiák és teljesítmény

A kiszolgáló infrastruktúra az NVIDIA Dynamo, a vLLM, a Mooncake és a FlashInfer technológiákat ötvözi. A fejlesztést az Inferact és az NVIDIA segítségével végezték, a javításokat pedig az upstream projektekbe is hozzájárulták. A célmunkafolyamat az ügynökalapú (agentic) feladatok kiszolgálása. Egy tipikus ügynöki kör körülbelül 6000 tokent ad egy 140 000 tokenes prompt mellé. A Prime Intellect tesztjei szerint ez a kombináció közel 40%-kal csökkenti a p90 inter-token késleltetést a belső összehasonlításokhoz képest.

A GLM-5.3 modell GB200 NVL72 hardveren futtatva a célinteraktivitás másodpercenként 100 végpont-végpont token volt felhasználónként. Ezen a szinten az 1:4 előkészítési/dekódolási arány 66 munkamenetet tudott kiszolgálni előkészítési csoportonként, másodpercenként 101 token/felhasználó sebességgel és másodpercenként 100 kimeneti tokent GPU-nként. Az NVFP4 KV tömörítés révén a gyorsítótár sor mérete 576 bájtól 352 bájtig csökkent, ami növelte a dekóderenként gyorsítótárazható tokenek számát 1,09 millióról 1,63 millióra.

A megbízható funkcióhívások érdekében a Prime Intellect egy strukturális címke-építőt fejlesztett a Dynamohoz a GLM eszközformátumához. A vLLM ezután az xgrammar segítségével maszkolja azokat a tokeneket, amelyek megsértik az eszközsémát. A csapat kijavított néhány elemzési hibát is, például a `<` karakter dekódolását `<` kódon belülre.

A Prime Inference a tervek szerint batch feldolgozási lehetőséggel és egy kattintással elérhető dedikált telepítésekkel bővül.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom