ÉlőUtoljára: 1 órájaMa: 15
Kutatásfrissítve: 08:15

Fizikai módszert használt az LLM-ek tömörítésére a Multiverse Computing

A Multiverse Computing kutatói egy új módszert dolgoztak ki az LLM-ek blokkjainak eltávolítására, ami 50%-os tömörítés mellett 23 százalékponttal javítja a Llama-3.3-70B-Instruct modell MMLU-teljesítményét.

Fizikai módszert használt az LLM-ek tömörítésére a Multiverse Computing
Fotó: Aleksandr Lyaptsev / Unsplash
forrás: Hugging Face·AI Forradalom szerk.·
Megosztás

Az LLM-ek sebességének növelésére az egyik legolcsóbb módszer a transzformer blokkok egyszerű törlése. Ez a blokkeltávolítás, más néven mélységi metszés, kiszámítható sebességnövekedést és memóriamegtakarítást eredményez, és jól kombinálható kvantálással vagy alacsony-rangú tömörítéssel. A kihívás a megfelelő blokkok kiválasztása: a rosszak eltávolítása összeomlást okozhat, és a döntések kölcsönhatásban állnak egymással. Ezért a probléma nem rangsorolási, hanem kombinatorikus jellegű, amit a fizika, különösen a spin-rendszerek leírására alkalmas eszközei kezelni tudnak. (Hugging Face)

A Multiverse Computing legújabb tanulmánya, az „LLM Compression by Block Removal with Constrained Binary Optimization” ezt a megfelelést használja ki. A blokkok kiválasztását egy korlátozott bináris optimalizációs (CBO) problémává alakítják, amely közvetlenül egy Ising-üveghez, egy rendezetlen spin-rendszerhez kapcsolódik.

Az Ising-üveg energiája olcsó és megbízható mutatója a metszett modell teljesítményteszt-teljesítményének. Ez lehetővé teszi hatalmas számú jelöltkonfiguráció rangsorolását anélkül, hogy minden egyes változatot le kellene futtatni. Az eredmények jelentősek: 50%-os tömörítés mellett a Llama-3.3-70B-Instruct modellen 23 százalékpontos MMLU-javulást értek el a legjobb versenytárs blokkeltávolítási módszerekhez képest.

A blokkok kiválasztása mint soktestes probléma

A legtöbb jelenlegi blokkeltávolítási módszer minden egyes blokkot külön pontoz, majd a legkevésbé fontosakat távolítja el. Ezek a módszerek fizikai értelemben mean-field megközelítésnek felelnek meg: figyelmen kívül hagyják a blokkok közötti kölcsönhatásokat, mintha azok függetlenek lennének egymástól. Ez azonban nem fedi le a valóságot, hiszen egy blokk eltávolításának hatása függ attól, hogy mely más blokkokat távolítottak el vele együtt.

Ahogy a modellek egyre mélyebbek és heterogénebbek lesznek, ezeknek a kölcsönhatásoknak az elhanyagolása minőségveszteséggel járhat, különösen nagy tömörítési arányok esetén. A kutatók célja ezért az volt, hogy olyan módszert dolgozzanak ki, amely figyelembe veszi a blokkok interakcióit, még ha ez exponenciálisan növeli is a lehetséges kombinációk számát.

A blokkeltávolítás átalakítása energia-minimalizálási problémává

A kutatók minden transzformer blokkhoz egy bináris változót rendeltek: 0 a megtartást, 1 az eltávolítást jelenti. Ezt követően a modell veszteségének másodrendű Taylor-kifejtését végezték el ezekre a változókra, ami létrehozott egy aproximált Hessian-mátrixot. A mátrix átlója mutatja az egyes blokkok önálló fontosságát, míg az attól eltérő elemek a blokkok közötti kölcsönhatásokat, a many-body fizikát képviselik.

Ez a megfogalmazás a „mely blokkokat távolítsam el?” kérdést egy optimalizációs problémává alakítja: az M blokk olyan halmazát kell megtalálni, amely minimalizálja az energia xᵀH⁰x értéket, miközben pontosan M blokkot távolítunk el az N blokkból.

Ez matematikailag egy korlátozott bináris optimalizációs probléma, fizikailag pedig egy Ising-üveg, ahol a rögzített számú eltávolított blokk játsza a fix teljes spin szerepét. A kulcsfontosságú megállapítás, hogy ez az energia erős proxy a későbbi minőségre: az alacsony energiájú spin-rendszeri állapotok magas teljesítményű, metszett modelleknek felelnek meg.

Megoldás: pontosan, ha lehet, kvantumszámítással, ha nem

A legtöbb modell esetében a konfigurációs tér nagy, de még ellenőrizhető. Mivel egy energia kiszámítása nagyon olcsó, a kutatók egyetlen GPU-n akár tízezermilliárd konfigurációt is ellenőrizhetnek. A legnehezebb, Llama-3.3-70B 80 blokkjából 8 eltávolítását vizsgáló eset (körülbelül 29 milliárd konfiguráció) nagyjából két napig tartott. Ezen a ponton a pontos megközelítés már nem működik, és itt jön a képbe az Ising-üveg modell.

A probléma QUBO (Quadratic Unconstrained Binary Optimization) formában, a korlátozást büntető tagba ágyazva, hatékonyan kezelhető klasszikus, kvantum- és kvantum-ihletésű optimalizálókkal, mint amilyeneket a Multiverse Computing is használ. Egy nyílt forráskódú tabu-kereső másodpercek alatt megbízhatóan hozza a legalacsonyabb energiájú állapotokat, még a legnehezebb esetekben is.

A lényeg, hogy nem feltétlenül a legmélyebb energiájú állapotot kell megtalálni, hanem egy gyors módszert a jó, alacsony energiájú állapotok generálására. Ezért a könnyűsúlyú optimalizálók is jól működnek, és többjük futtatása is belefér az erőforrásokba. Az energia erős proxy a minőségre, de nem tökéletes, így az egyetlen legalacsonyabb energiájú állapot nem mindig a legjobb modell.

Ez azonban előny: a Hamilton-függvény felállítása után a ground state és az alacsonyabb gerjesztett állapotok kiolvasása lényegében ingyenes, így ahelyett, hogy egyetlen, törékeny válaszunk lenne, a kiváló minőségű jelölt-metszések spektrumát próbálhatjuk ki. A kutatás 2026. szeptember 21-én jelent meg előnyomtatott formában.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom