A nyelvi modelleknek is aludniuk kell, új kutatás szerint anterográd amnéziában szenvednek
A nyelvi modellek a betanítás után nem tanulnak új információkat, ami anterográd amnéziához hasonlít — állítják a Google és a Cornell kutatói új tanulmányukban.

A nyelvi modelleknek, amelyeket nap mint nap használunk, van egy kényelmetlen tulajdonságuk: nem tanulnak semmit sem újabban. Amit egy csúcskategóriás modell tud, azt egyszer tanulta meg a betanítás során, majd elmentették. Ezt követően egy zseniális fosszíliává válik. Képes köröket futni az ember körül az adatkieséséig terjedő eseményekről, majd teljesen üres fejjel áll a múlt kedd eseményei előtt. (TheSequence)
Behrouz, Hashemi és Mirrokni, a Google és a Cornell kutatói új tanulmányukban elnevezték ezt az állapotot anterográd amnéziának. Az anterográd amnéziában szenvedő beteg minden, a sérülés előtti emléket megőriz, és képes a pillanatnyi beszélgetést fenntartani, de semmi új nem jut be a hosszú távú tárolóba. Minden napot úgy él meg, mintha az első lenne. Ha a „sérülést” a „pre-training vége” szavakkal helyettesítjük, pontosan ez a Transformer-memória alakja. Megvan a mély múlt (az MLP súlyok) és a közvetlen jelen (az attention cache), és szinte semmi sem köti össze őket.
Kapcsolódó: LLM tagadáskezelés
A nyelvi modellek korlátai
A kutatók szerint hiányzik egy lépés, amelyet a biológia már régen kitalált: az alvás. Jelenleg a modellek nem képesek új információkat megjegyezni a betanítás befejezése után, ami azt jelenti, hogy a kontextusablakba betöltött új tények az ülés végén elpárolognak.
Kapcsolódó: neuronok eltávolítása
A jövőbeli fejlesztések iránya
Ez a probléma arra utal, hogy a jelenlegi tréning-teszt felosztás elavulttá válik. A Google és a Cornell kutatói a Transformer modell továbbfejlesztésén dolgoznak, hogy a modellek képesek legyenek új információkat tanulni és megjegyezni a betanítás befejezése után is, a Google Transformer modelljének frissítése 2026-ra várható.
Kapcsolódó: HORIZON teljesítményteszt