Új multimódális AI-modellt adott ki az Alibaba Qwen
Az Alibaba Qwen bemutatta a Qwen3.8-Omni-Flash nevű, multimódális AI-modelljét, amely képes szöveget, képet, hangot és videót feldolgozni, miközben 1 millió tokenes kontextusablakkal és agenti képességekkel rendelkezik.

Az Alibaba Qwen csapata kiadta a Qwen3.8-Omni-Flash modellt, amely az első olyan multimódális AI-megoldásuk, amely agenti funkciókra épül. A modell képes szöveget, képet, hangot és videót elfogadni, és szöveges kimenetet generál. Az audio- és videóértelmezés, a következtetés és az eszköztár használata egyetlen modellen belül valósul meg. (MarkTechPost)
A modell ügynöki munkafolyamata egyszerű: megérti a tartalmat, megtervezi a feladatot, végrehajtja az eszközökkel, majd eljuttatja az eredményt. A Qwen3.8-Omni-Flash a Qwen3.8-Flash-Next architektúrára épül, amelynek alapmodellje 2026 augusztusában jelent meg nyílt súlyokkal. A modell 1 millió tokenes kontextusablakkal rendelkezik, amelyből 991 ezer token a maximális bemeneti, 131 ezer a maximális kimeneti, és 262 ezer a maximális következtetési hossz.
A modell képes a videókban rejlő lényeges információkat több körös, durva-finom elemzéssel kinyerni, így a számítási kapacitást és a tokenhasználatot azokra a szegmensekre koncentrálja, amelyek a legfontosabbak. A Qwen kutatócsapata szerint az OmniVideoBench teljesítményteszten az eredményesség 63,4%-ról 67,8%-ra emelkedett, miközben a tokenhasználat 45,7%-kal csökkent, 145 736-ról 79 117 tokenre.
Az Alibaba saját bevallása szerint a Qwen3.8-Omni-Flash 29 értékelésen átlagosan több mint 25%-os javulást mutat a Qwen3.5-Omni-Plus modellhez képest. Az audio- és vizuális teljesítményük állításuk szerint megközelíti vagy meghaladja a Gemini 3.8 Flash modellét, míg az általános audio teljesítménye felülmúlja azt.
A QwenCloud árazása 0,15 dollár per 1 millió bemeneti token, 0,47 dollár per 1 millió kimeneti token, míg a gyorsítótárban tárolt tokenek 0,016 dollárba kerülnek 1 millió egységenként. Az audio- és videóbemenetek óránkénti költsége jelentősen csökkent a korábbi verziókhoz képest. A modell API-ként érhető el hat régióban: Peking, Szingapúr, Hongkong, Tokió, Frankfurt és Virginia.
A modell szöveges kimenetet generál, így az audio- és videofeldolgozást az erre szolgáló eszközök végzik. Az Alibaba ehhez két nyílt forráskódú projektet, a Qwen-MM-Plugins és a Qwen-Live Harness-t bocsátotta rendelkezésre. A Qwen-MM-Plugins Apache-2.0 licenc alatt érhető el, és lehetővé teszi, hogy az ügynökök multimódális képességekkel rendelkezzenek.