ÉlőUtoljára: az iméntMa: 25
Modellek & LLMfrissítve: 16:17

Nyolcadára csökkentette a memóriahasználatot a DeepSeek

A DeepSeek V4.1-Flash architektúrája drasztikusan csökkenti a KV-cache használatát, így olcsóbbá és hatékonyabbá teszi az AI-ügynökök működését.

Nyolcadára csökkentette a memóriahasználatot a DeepSeek
Fotó: Zach M / Unsplash
forrás: The Neuron·AI Forradalom szerk.·
Megosztás

Az AI-ügynökök egyik fő problémája, hogy a hosszabb ideig tartó feladatok során rengeteg információt kell megjegyezniük. Egy kétórás kutatási feladat során a beszélgetési előzmények óriásivá duzzadhatnak, ami lassítja a modell működését. A DeepSeek új V4.1-Flash modellje erre a problémára kínál megoldást. (The Neuron)

A DeepSeek V4.1-Flash 552 milliárd paraméteres alapmodellt és egy további 196 milliárd paraméteres, Engram nevű memóriarendszert tartalmaz. Emellett natív képfelismeréssel és egymillió tokenes kontextusablakkal rendelkezik. A fejlesztők az architektúra átalakításával, a tárolt kontextus mennyiségének csökkentésével és a már elvégzett munka újrahasznosításával érték el a hatékonyságnövekedést.

A DeepSeek szerint az új modell a globális KV-cache használatát negyedére, míg a perzisztens KV-cache tárolását nagyjából a nyolcadára csökkenti elődjéhez, a V4-Flash-hez képest azonos munkaterhelés mellett. Ez a csökkentés strukturális változást jelent a modell működésében és költséghatékonyságában.

A KV-cache használatának csökkenése nem csupán a memóriaigényt mérsékli, hanem jelentősen csökkenti az AI-ügynökök futtatásának költségeit is. A DeepSeek V1-hez képest ez 437-szeres csökkenést jelent. Az új architektúra a korábbiaknál kevesebb nagy sávszélességű memóriát igényel az aktív KV-cache számára, és kevesebb SSD-tárolót a perzisztens cache számára.

A DeepSeek V4.1-Flash modellje versenyképes teljesítményt mutat a csúcskategóriás modellekkel több AI-ügynök-teljesítményteszten. Az SWA Bounded Replay módszerrel a modell nem tárolja az egész csúszóablakos figyelmi állapotot SSD-n, hanem csak a legutóbbi tokenablak újrajátszásával rekonstruálja azt.

Forrás

Feldolgozott sajtóforrás·The Neuron

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom