Titokban vette át a DeepSeek kosztuscsökkentő trükkjeit az OpenAI és az Anthropic
A kínai DeepSeek által megosztott KV-cache optimalizációk drasztikusan csökkentik az OpenAI és az Anthropic modelljeinek költségeit, miközben a nyugati cégek csendben integrálják a technikákat.

A nyugati AI-cégek, mint az OpenAI és az Anthropic, titokban vették át a kínai DeepSeek által kifejlesztett KV-cache optimalizációs technikákat. A DeepSeek által megosztott áttörés drasztikusan, akár 437-szeresére csökkenti a hosszú kontextusú modellek memóriahasználatát, ami a GPU-költségek jelentős csökkenéséhez vezet. A DeepSeek-V4.1-Flash modell már tokenenként mindössze 890 byte-ot használ a globális KV-cache-ből. (Hacker News)
Az újítások közé tartozik az MLA architektúra, amely 15-szeres tömörítést ért el, valamint a Compressed Sparse Attention és a Heavily Compressed Attention technikák. Ezek a fejlesztések kulcsfontosságúak a hosszú kontextusú modellek futtatásánál, ahol a VRAM-költség az egyik legnagyobb kiadás. A DeepSeek kutatói a korábbi modellekhez képest jelentősen, 437-szeresére csökkentették a KV-cache méretét.
Az OpenAI GPT-6.1 Sol modellje 80%-kal, az Anthropic Claude Opus 5.5 pedig 60%-kal csökkentette a cache-olvasási árait a korábbi verziókhoz képest. A kínai laborok ezeket az áttöréseket ingyenesen osztják meg, ellentétben a nyugati cégekkel, amelyek gyakran titkolják fejlesztéseiket. A nyugati AI-cégek emiatt „rendkívül profit-pozitívvá” váltak az inferenciás költségeket illetően.
A DeepSeek által megosztott technológiák, mint a CSA2, a cross-layer cache reuse és az FP4 caching, lehetővé teszik a modellek hatékonyabb futtatását. Az OpenAI és az Anthropic új csúcskategóriás modelljei, a GPT-6.1 Sol és a Claude Opus 5.5, ezeket az optimalizációkat hasznosítják, bár a cégek csendben vezették be őket, mintha kissé feszengnének a másolás miatt.
A kínai kutatók döntése, hogy ilyen jelentős fejlesztéseket ingyen tesznek közzé, továbbra is rejtély. A nyugati cégek számára azonban ez jelentős előnyt jelent a költséghatékonyságban, miközben a korábbi narratíva a kínai modellek veszélyességéről háttérbe szorul. A DeepSeek V4.1 Flash modell tokenenként 890 byte-os cache-mérete új mércét állít a piacon.