Nyolcadára csökkentette a memóriahasználatot a DeepSeek
A DeepSeek V4.1-Flash architektúrája drasztikusan csökkenti a KV-cache használatát, így olcsóbbá és hatékonyabbá teszi az AI-ügynökök működését.

Az AI-ügynökök egyik fő problémája, hogy a hosszabb ideig tartó feladatok során rengeteg információt kell megjegyezniük. Egy kétórás kutatási feladat során a beszélgetési előzmények óriásivá duzzadhatnak, ami lassítja a modell működését. A DeepSeek új V4.1-Flash modellje erre a problémára kínál megoldást. (The Neuron)
A DeepSeek V4.1-Flash 552 milliárd paraméteres alapmodellt és egy további 196 milliárd paraméteres, Engram nevű memóriarendszert tartalmaz. Emellett natív képfelismeréssel és egymillió tokenes kontextusablakkal rendelkezik. A fejlesztők az architektúra átalakításával, a tárolt kontextus mennyiségének csökkentésével és a már elvégzett munka újrahasznosításával érték el a hatékonyságnövekedést.
A DeepSeek szerint az új modell a globális KV-cache használatát negyedére, míg a perzisztens KV-cache tárolását nagyjából a nyolcadára csökkenti elődjéhez, a V4-Flash-hez képest azonos munkaterhelés mellett. Ez a csökkentés strukturális változást jelent a modell működésében és költséghatékonyságában.
A KV-cache használatának csökkenése nem csupán a memóriaigényt mérsékli, hanem jelentősen csökkenti az AI-ügynökök futtatásának költségeit is. A DeepSeek V1-hez képest ez 437-szeres csökkenést jelent. Az új architektúra a korábbiaknál kevesebb nagy sávszélességű memóriát igényel az aktív KV-cache számára, és kevesebb SSD-tárolót a perzisztens cache számára.
A DeepSeek V4.1-Flash modellje versenyképes teljesítményt mutat a csúcskategóriás modellekkel több AI-ügynök-teljesítményteszten. Az SWA Bounded Replay módszerrel a modell nem tárolja az egész csúszóablakos figyelmi állapotot SSD-n, hanem csak a legutóbbi tokenablak újrajátszásával rekonstruálja azt.