ÉlőUtoljára: 21 perceMa: 12
Modellek & LLMfrissítve: 08:15

Új modellt adott ki a DeepSeek, visszatér a kínai cég a nyílt AI-piacra

A DeepSeek V4.1-Flash modell 763 milliárd paraméterrel, 1 millió tokenes kontextusablakkal és natív látásértéssel érkezik, a korábbi V4 Pro modellt váltja le.

Új modellt adott ki a DeepSeek, visszatér a kínai cég a nyílt AI-piacra
Fotó: Growtika / Unsplash
forrás: Latent Space·AI Forradalom szerk.·
Megosztás

A DeepSeek bemutatta új, DeepSeek-V4.1-Flash nevű modelljét, amely egy új kauzális encoder-decoder architektúrát használ, natív vizuális megértéssel. A modellcsalád legkisebb tagja 763 milliárd paraméterrel rendelkezik, és a korábbi V4 Pro modellt váltja le. (Latent Space)

A DeepSeek kutatási stratégiája lenyűgöző: a fő verziók (v2, v3, v4) között köztes papírokat adtak ki, amelyek hiperfókuszált architekturális fejlesztéseket mutattak be, és szinte 100%-os találati arányt értek el olyan területeken, mint a matematika (különösen a GRPO), a kódgenerálás és az R1. A korábbi, nagy figyelmet kapott R1 papír után a DeepSeek visszavonult, és hagyta, hogy olyan riválisok, mint a GLM és a Kimi vezessék a nyílt modellek terét. Most azonban visszatértek egy új architektúrával, amely a kontextus kreatív és hatékony felhasználására összpontosít.

A DeepSeek-V4.1-Flash modellcsalád legkisebb tagja 763 milliárd teljes paraméterrel rendelkezik, ebből 8 milliárd aktív bemeneti (P8B) és 16 milliárd aktív kimeneti (D16B) paraméter. Ez a megközelítés, amelyet a DeepSeek v4.1 Flash technikai jelentése is részletez, az úgynevezett „prefill/decode separation”-re épít, és újításokat, mint a Sliding-Window Attention Bounded Replay, tesz lehetővé. Ez akár nyolcadára csökkenti a KV cache lábnyomát a korábbi V4 Flash-hez képest, ami gyorsabbá, olcsóbbá és hatékonyabbá teszi a hosszú kontextusokat kezelő ügynökök számára.

Bár a DeepSeek elismeri, hogy a V4.1-Flash bizonyos benchmarkokon technikailag elmarad más nyílt modellek mögött, a cég szerint a jelenlegi mérőeszközök nem képesek megragadni a modell kreatív és hatékony kontextusfelhasználását. A DeepSeek szerint az adatok minőségének javítása sokkal nagyobb megtérülést hoz, mint az új utókövetési algoritmusok fejlesztése.

A DeepSeek-V4.1-Flash modell MIT licenc alatt érhető el, és az Egyesült Államokban API-n keresztül is elérhető. A modell árazása 0,30 dollár/1 millió bemeneti token és 1,20 dollár/1 millió kimeneti token, gyorsítótárazott bemenettel 0,006 dollár/1 millió token, valamint további 50%-os kedvezménnyel csúcsidőn kívül.

Forrás

Feldolgozott sajtóforrás·Latent Space

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom