Képeket is értelmez a Deepseek V4-Flash-Vision-Exp, közelít az Opus 4.8-hoz
A Deepseek V4-Flash-Vision-Exp új multimodális modellje képfeldolgozási képességekkel bővíti a korábbi verziót, és a cég saját benchmarkjai szerint megközelíti vagy meghaladja az Opus 4.8-at ügynökfeladatokban.

A kínai Deepseek bemutatta kísérleti V4-Flash-Vision-Exp multimodális modelljét, amely képértelmezési funkciókkal egészíti ki a korábbi szövegalapú képességeket. A cég közlése szerint a modell a Deepseek saját ügynöki benchmarkjain közelíti, sőt néha meg is haladja az Anthropic Opus 4.8-as modelljét — írja a THE DECODER.
A V4-Flash-Vision-Exp a V4-Flash modellt bővíti képfeldolgozási funkciókkal, miközben megőrzi az alapmodell szöveges teljesítményét a következtetésben és a világismeretben. A Deepseek célja, hogy a modellt elsősorban ügynökalapú alkalmazásokhoz pozicionálja, ahol a vizuális megértést az eszközhasználattal kombinálja. A gyakorlatban ez azt jelenti, hogy a modell képes képeket leírni, szöveget kivonni képernyőképekből, valamint diagramokat elemezni.
Képfeldolgozás és kompatibilitás
A modell JPEG, PNG, GIF és WebP formátumokat támogatja, és a fájlnevek vagy MIME-típusok helyett magából a fájltartalomból határozza meg a formátumot. A vizuális képességek hozzáadásával a Deepseek új modellje megközelíti vagy néha meg is haladja az Opus 4.8-at az ügynöki benchmarkokon. A modell kompatibilis az OpenAI Chat Completions és Responses API-jaival, valamint az Anthropic Messages végpontjával. A Deepseek emellett kiadta a Harness keretrendszer 0.1.1-es verzióját is, amely azonnal támogatja az új modellt.
Árazás és képkorlátok
A képek modellel való megosztására három lehetőség van: a fejlesztők beágyazhatják azokat Base64 kódolással, mutathatnak rájuk nyilvánosan elérhető URL-eken keresztül (legfeljebb 32 MiB méretig), vagy használhatják az új, ingyenes Files API-t. Ez utóbbi lehetővé teszi a fájlok egyszeri feltöltését és azonosítóval történő hivatkozást több kérés során, 64 MiB-os méretkorláttal. Az opcionális „detail” mező 512 x 512 pixelesre kicsinyíti a képeket, így tokeneket takarít meg, ha nincs szükség finom vizuális részletekre.
A modell automatikusan nagyjából 800 x 800 pixelesre normalizálja a képeket az oldalaránytól függően. Az eredeti felbontástól függetlenül minden kép legfeljebb 384 tokent kóstál. Az árazás megegyezik a V4-Flash tarifáival. Egyetlen kérés akár 600 képet is tartalmazhat. Az oldalak maximális hossza 8192 pixel, de ez 4096 pixelre csökken, ha egy kérés 15 vagy több képet tartalmaz.