
3 milliárd letöltést ért el az Alibaba Qwen modellje, a Hugging Face szerint kevesebbet
A kínai cég ezzel a legnépszerűbb nyílt AI-modellcsaládnak tartja magát, ám a Hugging Face jelentése szerint a valós letöltésszám mindössze 2,045 milliárd.
A Qwen az Alibaba nyílt súlyú nagy nyelvi modellcsaládja, a kínai AI-fejlesztés egyik zászlóshajója, amely a nyílt modellek globális rangsorában is élen jár. Ezen az oldalon a Qwen magyar nyelvű híreit találod: új verziók, benchmarkok és integrációk.
31 cikk ebben a témában

A kínai cég ezzel a legnépszerűbb nyílt AI-modellcsaládnak tartja magát, ám a Hugging Face jelentése szerint a valós letöltésszám mindössze 2,045 milliárd.

Az Alibaba Qwen kutatólaborjának új, Apache 2.0 licencű, 27 milliárd paraméteres Qwen 3.8 27B modellje alapértelmezetten „xhigh” reasoning erőfeszítést végez, ami drasztikusan megnöveli a generálási időt.

A Qwen 3.6 27B modell a DeepSWE teszten 32 millió token kimenetet generált átlagosan feladatonként. Ezzel a teljesítménnyel a 20 modell közül a 18. helyre került.

Egy felhasználó tapasztalatai szerint a Qwen3.6 27B modell 16 GB VRAM-mal és 32 GB DDR5 RAM-mal futtatva a KV cache RAM-ba mentésével jelentősen növelhető a kontextus ablak mérete. A sebességcsökkenés minimális, 14 tps érhető el.

A Qwen-Scope a Qwen3 és Qwen3.5 modellcsaládokra betanított sparse autoencoder (SAE) csomag, amely 7 modellváltozaton keresztül 14 SAE súlycsoportot tartalmaz.

A kutatók a mentális egészségügyi adatok hiányát szintetikus szöveggenerálással próbálják enyhíteni.

A modell mérete mindössze 55,6 GB, ami jelentősen kisebb, mint a korábbi verzióé, miközben a kódolási teljesítménye zászlóshajó szintű marad.

Az új eszköz irodalomkutatástól az adathalmaz-felderítésen át a betanítási szkriptek végrehajtásáig minden lépést elvégez, jelentősen felgyorsítva a fejlesztési ciklust.

A Llama-3.1-8B modell jobban alkalmazkodik a romanizált nepáli nyelvhez, mint a Mistral-7B-v0.1 és a Qwen3-8B, különösen finomhangolás után.

A mesterséges intelligencia modellek finomhangolása során gyakran romlik a teljesítmény, ha a tanító modell stílusa eltér a tanulóétól, de egy új módszer orvosolhatja ezt a problémát.

A modell 35 milliárd paraméterből mindössze 3 milliárdot aktivál következtetéskor, ezzel jelentősen csökkentve a számítási igényt és a költségeket.

A Qwen3.6-Plus modell integrálásra kerül a Qwen chatbot alkalmazásba és az új vállalati AI szolgáltatásba, a Wukongba.

A Qwen csapat hibrid figyelemmechanizmust és MoE-architektúrát ötvöző új modellt mutatott be, amely a Claude 4.6 Opus gondolkodási mintáit sajátította el.
Tetszik az oldal? Támogasd a fejlesztést
Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.