ÉlőUtoljára: 3 perceMa: 23
Modellek & LLMfrissítve: 17:16

Új multimódális AI-modellt adott ki az Alibaba Qwen

Az Alibaba Qwen bemutatta a Qwen3.8-Omni-Flash nevű, multimódális AI-modelljét, amely képes szöveget, képet, hangot és videót feldolgozni, miközben 1 millió tokenes kontextusablakkal és agenti képességekkel rendelkezik.

Új multimódális AI-modellt adott ki az Alibaba Qwen
Fotó: Kevin Ache / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

Az Alibaba Qwen csapata kiadta a Qwen3.8-Omni-Flash modellt, amely az első olyan multimódális AI-megoldásuk, amely agenti funkciókra épül. A modell képes szöveget, képet, hangot és videót elfogadni, és szöveges kimenetet generál. Az audio- és videóértelmezés, a következtetés és az eszköztár használata egyetlen modellen belül valósul meg. (MarkTechPost)

A modell ügynöki munkafolyamata egyszerű: megérti a tartalmat, megtervezi a feladatot, végrehajtja az eszközökkel, majd eljuttatja az eredményt. A Qwen3.8-Omni-Flash a Qwen3.8-Flash-Next architektúrára épül, amelynek alapmodellje 2026 augusztusában jelent meg nyílt súlyokkal. A modell 1 millió tokenes kontextusablakkal rendelkezik, amelyből 991 ezer token a maximális bemeneti, 131 ezer a maximális kimeneti, és 262 ezer a maximális következtetési hossz.

A modell képes a videókban rejlő lényeges információkat több körös, durva-finom elemzéssel kinyerni, így a számítási kapacitást és a tokenhasználatot azokra a szegmensekre koncentrálja, amelyek a legfontosabbak. A Qwen kutatócsapata szerint az OmniVideoBench teljesítményteszten az eredményesség 63,4%-ról 67,8%-ra emelkedett, miközben a tokenhasználat 45,7%-kal csökkent, 145 736-ról 79 117 tokenre.

Az Alibaba saját bevallása szerint a Qwen3.8-Omni-Flash 29 értékelésen átlagosan több mint 25%-os javulást mutat a Qwen3.5-Omni-Plus modellhez képest. Az audio- és vizuális teljesítményük állításuk szerint megközelíti vagy meghaladja a Gemini 3.8 Flash modellét, míg az általános audio teljesítménye felülmúlja azt.

A QwenCloud árazása 0,15 dollár per 1 millió bemeneti token, 0,47 dollár per 1 millió kimeneti token, míg a gyorsítótárban tárolt tokenek 0,016 dollárba kerülnek 1 millió egységenként. Az audio- és videóbemenetek óránkénti költsége jelentősen csökkent a korábbi verziókhoz képest. A modell API-ként érhető el hat régióban: Peking, Szingapúr, Hongkong, Tokió, Frankfurt és Virginia.

A modell szöveges kimenetet generál, így az audio- és videofeldolgozást az erre szolgáló eszközök végzik. Az Alibaba ehhez két nyílt forráskódú projektet, a Qwen-MM-Plugins és a Qwen-Live Harness-t bocsátotta rendelkezésre. A Qwen-MM-Plugins Apache-2.0 licenc alatt érhető el, és lehetővé teszi, hogy az ügynökök multimódális képességekkel rendelkezzenek.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom