ÉlőUtoljára: 8 perceMa: 21
Üzlet & Startupfrissítve: 13:15

Titokban vette át a DeepSeek kosztuscsökkentő trükkjeit az OpenAI és az Anthropic

A kínai DeepSeek által megosztott KV-cache optimalizációk drasztikusan csökkentik az OpenAI és az Anthropic modelljeinek költségeit, miközben a nyugati cégek csendben integrálják a technikákat.

Titokban vette át a DeepSeek kosztuscsökkentő trükkjeit az OpenAI és az Anthropic
Fotó: Winston Chen / Unsplash
forrás: Hacker News·AI Forradalom szerk.·
Megosztás

A nyugati AI-cégek, mint az OpenAI és az Anthropic, titokban vették át a kínai DeepSeek által kifejlesztett KV-cache optimalizációs technikákat. A DeepSeek által megosztott áttörés drasztikusan, akár 437-szeresére csökkenti a hosszú kontextusú modellek memóriahasználatát, ami a GPU-költségek jelentős csökkenéséhez vezet. A DeepSeek-V4.1-Flash modell már tokenenként mindössze 890 byte-ot használ a globális KV-cache-ből. (Hacker News)

Az újítások közé tartozik az MLA architektúra, amely 15-szeres tömörítést ért el, valamint a Compressed Sparse Attention és a Heavily Compressed Attention technikák. Ezek a fejlesztések kulcsfontosságúak a hosszú kontextusú modellek futtatásánál, ahol a VRAM-költség az egyik legnagyobb kiadás. A DeepSeek kutatói a korábbi modellekhez képest jelentősen, 437-szeresére csökkentették a KV-cache méretét.

Az OpenAI GPT-6.1 Sol modellje 80%-kal, az Anthropic Claude Opus 5.5 pedig 60%-kal csökkentette a cache-olvasási árait a korábbi verziókhoz képest. A kínai laborok ezeket az áttöréseket ingyenesen osztják meg, ellentétben a nyugati cégekkel, amelyek gyakran titkolják fejlesztéseiket. A nyugati AI-cégek emiatt „rendkívül profit-pozitívvá” váltak az inferenciás költségeket illetően.

A DeepSeek által megosztott technológiák, mint a CSA2, a cross-layer cache reuse és az FP4 caching, lehetővé teszik a modellek hatékonyabb futtatását. Az OpenAI és az Anthropic új csúcskategóriás modelljei, a GPT-6.1 Sol és a Claude Opus 5.5, ezeket az optimalizációkat hasznosítják, bár a cégek csendben vezették be őket, mintha kissé feszengnének a másolás miatt.

A kínai kutatók döntése, hogy ilyen jelentős fejlesztéseket ingyen tesznek közzé, továbbra is rejtély. A nyugati cégek számára azonban ez jelentős előnyt jelent a költséghatékonyságban, miközben a korábbi narratíva a kínai modellek veszélyességéről háttérbe szorul. A DeepSeek V4.1 Flash modell tokenenként 890 byte-os cache-mérete új mércét állít a piacon.

Háttér: a Claude ingyenes csomagja magyarul

Forrás

Feldolgozott sajtóforrás·Hacker News

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom