ÉlőUtoljára: 1 órájaMa: 17
Modellek & LLMfrissítve: 11:50

3 milliárd paraméteres AI modell éri utol a 700 milliárdosokat komplex feladatokban

A 3 milliárd paraméteres VibeThinker-3B modell a Sina Weibo kutatói szerint 96,1%-os elfogadási arányt ért el egy új, nehezen megoldható kódolási teszten.

3 milliárd paraméteres AI modell éri utol a 700 milliárdosokat komplex feladatokban
Fotó: Jimmy Liu / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A mesterséges intelligencia (AI) kutatásában eddig a hatalmas méret diktálta a tempót, milliárdos paraméterekkel próbálták elérni a komplex kognitív küszöböket. A Sina Weibo Inc. (Kína) kutatói azonban más utat választottak: a VibeThinker-3B nevű, mindössze 3 milliárd paraméteres modell bizonyítja, hogy a hatékonyság is lehet erőteljes. A MIT licenc alatt megjelent VibeThinker-3B a megerősíthető matematikai, kódolási és STEM feladatokban felveszi a versenyt a nála több százszor nagyobb modellekkel — írja a MarkTechPost.

A VibeThinker-3B titka

A VibeThinker-3B egy kompakt, sűrű modell, amely a Qwen2.5-Coder-3B alapra épül. A kutatók nem a nulláról kezdték, hanem egy speciális, Spectrum-to-Signal Principle (SSP) nevű képzési keretrendszerrel finomhangolták. A folyamat során felügyelt finomhangolást (SFT), megerősítéses tanulást (RL) és ön-desztillációt alkalmaztak. A SFT széles teret nyit meg a helyes érvelési utakon, a RL pedig ezeket erősíti meg. A modell célja egyetlen feladat: az olyan érvelési feladatok, ahol egy ellenőrző képes megerősíteni a választ. A kutatók nagyobb, általános modelleket javasolnak nyílt tartományú tudást felölelő feladatokhoz; a VibeThinker-3B kifejezetten specialistának készült.

Kapcsolódó: Qwen3.6 kódoló ügynök

Számszerű teljesítmény

A VibeThinker-3B kiemelkedő eredményeket mutatott fel a benchmarkokon. Az AIME26 teszten 94,3%-os pontszámot ért el, ami a DeepSeek V3.2 (671 milliárd paraméter) és a Kimi K2.5 (1 trillió paraméter) eredményeihez hasonlítható. A LiveCodeBench v6-on 80,2%-os Pass@1 eredményt produkált, míg egy új, tesztelésen kívüli (out-of-distribution) LeetCode teszten 128-ból 123 Python-beküldés volt sikeres elsőre, ami 96,1%-os elfogadási arányt jelent. A HMMT25 teszten 89,3%-ot, az IMO-AnswerBench-en pedig 76,4%-ot ért el. A GPQA-Diamond, egy tudásintenzív teljesítményteszten látható a különbség a nagyobb modellekhez képest, de a matematikai és kódolási feladatokban a 3 milliárdos modell a legjobb modellek közelében teljesít.

Kapcsolódó: Qwen3.6 multimodális fejlesztés

Hatékony futtatás egyetlen GPU-n

A modell súlyai (weights) mindössze körülbelül 6 GB-ot foglalnak el BF16 formátumban, így akár egyetlen GPU-n is futtatható a standard szoftverkönyvtárakkal, mint a transformers (≥ 4.54.0), vLLM (0.10.1) vagy SGLang (≥ 0.4.9.post6). Ez lehetővé teszi a költséghatékony működtetést és az on-device (eszközön belüli) alkalmazásokat is. A SSP képzési eljárás négy szakaszból áll, amelyek célja a kis érvelő modellek gyengeségeinek kiküszöbölése. A modell progresszív kontextusbővítés nélkül, egyetlen 64K-s kontextusablakkal dolgozik, ami a kutatók szerint ebben a méretben nem rontja a hosszú érvelési képességeket.

Kapcsolódó: Gemini 3 teljesítményteszt

Használati esetek és elérhetőség

A VibeThinker-3B ideális választás lehet versenyekre felkészítő matematikai oktatáshoz, algoritmusok fejlesztéséhez vagy költséghatékony AI-háttérrendszerekhez. A 3 milliárdos modell alacsony kiszolgálási költsége miatt sok kisebb, ellenőrizhető feladatot képes ellátni. A MIT licenc lehetővé teszi a nyílt forráskódú használatot, a súlyok pedig a Hugging Face-en érhetők el. A modell március végén kerül nyilvánosságra — az árképzés egyelőre ismeretlen.

Kapcsolódó: Qwen gondolkodási lánc

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom