Kisebb GGUF-modellekkel robbanhat az AI, új fejlesztések jönnek
A fejlesztések célja, hogy a kisebb GGUF-modellek teljesítményét tovább növeljék, miközben kompatibilisek maradnak a szokásos helyi inferenciaeszközökkel.

A 2- és 3-bites GGUF-modellek hamarosan jelentős fejlődésen mehetnek keresztül. A Google kutatói új algoritmust fejlesztettek ki a KV gyorsítótár (cache) 3 bit alá kvantálására, szinte nulla pontveszteséggel — közölte a Google Research. (Reddit LocalLLaMA)
A kutatások szerint a kisebb GGUF-modellek optimalizálása kulcsfontosságú lehet a modellek további fejlesztéséhez. A Google által kifejlesztett új algoritmus lehetővé teszi a 3 bit alatti kvantálást, ami jelentősen növelheti a modellek teljesítményét.
Kapcsolódó: Qwen 3.6 modell
A modell fejlesztés lehetőségei
A Reddit felhasználói szerint a MoQ GGUF és a GSQ modellek is ebbe az irányba mutatnak. Bár a GSQ modell jelenleg kissé elmarad a MoQ teljesítményétől, a MoQ 3.5-bites (ami valójában nem pontosan 3.5 bit, hanem elnevezési probléma) inicializálásából kiindulva jobb GSQ modell hozható létre — írja egy Reddit felhasználó.
Kapcsolódó: APEX MoE modellek
A fejlesztések hatása
A Google Research közleménye szerint a fejlesztések hatására a kisebb GGUF-modellek teljesítménye jelentősen növekedhet, ami új lehetőségeket teremthet az AI fejlesztésében. A Google kutatói folyamatosan dolgoznak a technológia fejlesztésén, és a legújabb eredmények a Google Research oldalán érhetők el.
Kapcsolódó: Qwen3.5 modell