4 bites modell verte a 16 bites eredetit, új módszer a tömörítéshez
A Quantization-Aware Healing (QAH) nevű új technika lehetővé teszi, hogy egy tömörített, 4 bites modell teljesítménye meghaladja eredeti, 16 bites verzióját. A GPT-OSS 120B modell 60 milliárd paraméterre tömörített, MXFP4-re kvantált verziója 7/9 teljesítményteszten múlta felül a bfloat16 alapértékű modellt.

A szabványos eljárás szerint először tömörítik az architektúrát, csökkentve a paraméterek számát rétegek, fejek vagy neuronok eltávolításával, majd a megmaradó súlyokat 4 bitesre kvantálják a memória- és számítási igény további csökkentése érdekében. Mindkét lépés jelentős megtakarítást eredményez, de együtt szisztematikusan rontják az olyan képességeket, mint a következtetés, a matematikai problémamegoldás és a kódgenerálás.
Emiatt a komoly telepítési folyamatok egy helyreállítási lépést, az úgynevezett „healing”-et is tartalmaznak, mielőtt a modell élesbe kerülne. A Hugging Face blogbejegyzése szerint a MultiverseComputingCAI kutatói által bemutatott Quantization-Aware Healing (QAH) módszer ezt a folyamatot forradalmasítja.
A korábbi módszerek, mint a quantization-aware training (QAT) és a quantization-aware distillation (QAD), nem elegendőek, ha a modell strukturális tömörítésen és kvantáláson is átesett. A QAT során hamis kvantáló operátorokat helyeznek be, és a modellt tovább finomhangolják, ami költséges és instabillá válhat.
A QAD az eredeti, teljes presíziós modellből tanít, de ez nem működik, ha a modell már strukturálisan is átalakult, mivel nincs függetlenül betanított, kisebb architektúrájú verzió. A MultiverseComputingCAI kutatói által bemutatott QAH ezzel szemben közvetlenül az eredeti, tömörítés előtti modellből tanít, figyelmen kívül hagyva az architektúrabeli különbségeket.
Eredmények a benchmarkokon
A QAH módszert egy GPT-OSS 120B modellre alkalmazták, amelyet 60 milliárd paraméterre tömörítettek, majd MXFP4 formátumra kvantáltak. Az eredmények megdöbbentőek: a 4 bites modell 7 a 9 teljesítményteszten múlta felül a saját, 60 milliárd paraméteres bfloat16 verzióját. A legnagyobb nyereség azokban a képességekben mutatkozott, amelyeket a tömörítés általában leginkább károsít: a hosszú kontextus-következtetés (+7,4 AA-LCR-en) és a matematika (+5,6 AIME 2025-ön). A modell nemcsak pontosabb lett, de kisebb és olcsóbb is futtatni, mint a kvantálás előtti ellenőrzőpont.
A QAH előnyei
A QAH módszer lényege, hogy a kvantálás nem egy veszteséges utófeldolgozási lépés, hanem a tanítás második, teljes köre az eredeti tanárral szemben. Mivel a KL-divergencia a tanár eloszlásához köti a diákot, a modell nem tud elmozdulni a fix tanítói eloszlástól, ami pontosságot és stabilitást biztosít. A 32k tokenes kontextus kezeléséhez a kutatók egy memóriahatékony, szeletelt KL-divergencia veszteséget használtak, amely illeszkedik a fix GPU memóriabudzséba.
A QAH-val készült 4 bites modell még az eredeti, 120 milliárd paraméteres tanítót is felülmúlja bizonyos feladatokon, például a LiveCodeBench-en (66,5 vs. 66,0). A legnagyobb, 1,6 pontos különbség az eredeti tanárhoz képest az AA-LCR teljesítményteszten tapasztalható, ahol a tömörítés okozta kapacitásveszteség helyreállítása különösen nehéz.
A kutatást a MultiverseComputingCAI publikálta a Hugging Face blogon augusztus 25-én.