ÉlőUtoljára: az iméntMa: 9
Modellek & LLMfrissítve: 03:16

Az Alibaba Qwen-Image-2.1-Turbo 5-ször gyorsabban generál képet

Az Alibaba Qwen-Image-2.1-Turbo modell 8 lépésben, 5-ször gyorsabban generál képeket, mint az alapváltozat, miközben azonos 7 milliárd paraméteres architektúrát használ.

Az Alibaba Qwen-Image-2.1-Turbo 5-ször gyorsabban generál képet
Fotó: Growtika / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

Az Alibaba Qwen csapata bemutatta a Qwen-Image-2.1-Turbo modellt, ami az eddigi 40 lépés helyett mindössze 8 lépésben képes képeket generálni és szerkeszteni. Ez a gyorsítás a 7 milliárd paraméteres architektúra megtartása mellett érhető el, így a fejlesztők számára 5-ször kevesebb feldolgozási lépést jelent. (MarkTechPost)

A Qwen-Image-2.1-Turbo a Qwen-Image-2.1 modell gyorsított változata. Az új modell megtartja az alapváltozat 2K felbontású képkészítési és szerkesztési képességeit, miközben a denoising lépések számát 40-ről 8-ra csökkenti. Az alap Qwen-Image-2.1 modell 60,28-as pontszámot ért el a Qwen-Image-Bench teszten, ami a legjobb eredmény a nyílt súlyú modellek között.

Az architektúra egy stream-es DiT (Diffusion Transformer), 32 réteggel és 7 milliárd paraméterrel. A szöveg- és referenciakép-kódolást a Qwen3-VL 8B modell végzi, míg a 64-csatornás RGBA autoencoder natív átlátszóságot tesz lehetővé. A prefix KV caching technológia újrahasznosítja a szöveges és referenciakép-kontextust a denoising lépések során, csökkentve a számítási terhelést.

A modell képes portrék, emberi testtartások, átlátszó képek, tipográfia és poszterek, valamint UI elrendezések generálására és szerkesztésére. Támogatja az akár 10 referenciaképet, valamint helyi szerkesztéseket körökkel, annotációkkal vagy maszkokkal. A generált képek alapértelmezetten 2048x2048 pixeles négyzet alakúak, de támogatja a 2752x1536 pixeles 16:9 arányt is.

A Qwen-Image-2.1-Turbo használatához a Diffusers könyvtár legfrissebb verziója és a transformers>=5.17.0 szükséges. Az Alibaba Cloud Model Studio felhőalapú API-t is kínál, amelynek díja 0,1 kínai jüan képenként, 120 RPM (kérés per perc) limit mellett. Ez 2,5-szer olcsóbb, mint a Pro verzió, amely 0,25 jüan/kép és 20 RPM limitet kínál.

A súlyok kutatási licenc alatt állnak, így kereskedelmi célú önálló üzemeltetéshez külön engedély szükséges. A Turbo modellhez specifikus teljesítményteszt még nem készült, de az alapmodell 60,28-as pontszámot ért el a Qwen-Image-Bench teszten.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom