ÉlőUtoljára: 56 perceMa: 4
Modellek & LLMfrissítve: 02:16

Képeket is értelmez a Deepseek V4-Flash-Vision-Exp, közelít az Opus 4.8-hoz

A Deepseek V4-Flash-Vision-Exp új multimodális modellje képfeldolgozási képességekkel bővíti a korábbi verziót, és a cég saját benchmarkjai szerint megközelíti vagy meghaladja az Opus 4.8-at ügynökfeladatokban.

Képeket is értelmez a Deepseek V4-Flash-Vision-Exp, közelít az Opus 4.8-hoz
Fotó: Growtika / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

A kínai Deepseek bemutatta kísérleti V4-Flash-Vision-Exp multimodális modelljét, amely képértelmezési funkciókkal egészíti ki a korábbi szövegalapú képességeket. A cég közlése szerint a modell a Deepseek saját ügynöki benchmarkjain közelíti, sőt néha meg is haladja az Anthropic Opus 4.8-as modelljét — írja a THE DECODER.

A V4-Flash-Vision-Exp a V4-Flash modellt bővíti képfeldolgozási funkciókkal, miközben megőrzi az alapmodell szöveges teljesítményét a következtetésben és a világismeretben. A Deepseek célja, hogy a modellt elsősorban ügynökalapú alkalmazásokhoz pozicionálja, ahol a vizuális megértést az eszközhasználattal kombinálja. A gyakorlatban ez azt jelenti, hogy a modell képes képeket leírni, szöveget kivonni képernyőképekből, valamint diagramokat elemezni.

Képfeldolgozás és kompatibilitás

A modell JPEG, PNG, GIF és WebP formátumokat támogatja, és a fájlnevek vagy MIME-típusok helyett magából a fájltartalomból határozza meg a formátumot. A vizuális képességek hozzáadásával a Deepseek új modellje megközelíti vagy néha meg is haladja az Opus 4.8-at az ügynöki benchmarkokon. A modell kompatibilis az OpenAI Chat Completions és Responses API-jaival, valamint az Anthropic Messages végpontjával. A Deepseek emellett kiadta a Harness keretrendszer 0.1.1-es verzióját is, amely azonnal támogatja az új modellt.

Árazás és képkorlátok

A képek modellel való megosztására három lehetőség van: a fejlesztők beágyazhatják azokat Base64 kódolással, mutathatnak rájuk nyilvánosan elérhető URL-eken keresztül (legfeljebb 32 MiB méretig), vagy használhatják az új, ingyenes Files API-t. Ez utóbbi lehetővé teszi a fájlok egyszeri feltöltését és azonosítóval történő hivatkozást több kérés során, 64 MiB-os méretkorláttal. Az opcionális „detail” mező 512 x 512 pixelesre kicsinyíti a képeket, így tokeneket takarít meg, ha nincs szükség finom vizuális részletekre.

A modell automatikusan nagyjából 800 x 800 pixelesre normalizálja a képeket az oldalaránytól függően. Az eredeti felbontástól függetlenül minden kép legfeljebb 384 tokent kóstál. Az árazás megegyezik a V4-Flash tarifáival. Egyetlen kérés akár 600 képet is tartalmazhat. Az oldalak maximális hossza 8192 pixel, de ez 4096 pixelre csökken, ha egy kérés 15 vagy több képet tartalmaz.

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom