ÉlőUtoljára: 33 perceMa: 13
Kutatásfrissítve: 02:30

A nyelvi modelleknek is aludniuk kell, új kutatás szerint anterográd amnéziában szenvednek

A nyelvi modellek a betanítás után nem tanulnak új információkat, ami anterográd amnéziához hasonlít — állítják a Google és a Cornell kutatói új tanulmányukban.

A nyelvi modelleknek is aludniuk kell, új kutatás szerint anterográd amnéziában szenvednek
Fotó: Michael / Unsplash
forrás: TheSequence·AI Forradalom szerk.·
Megosztás

A nyelvi modelleknek, amelyeket nap mint nap használunk, van egy kényelmetlen tulajdonságuk: nem tanulnak semmit sem újabban. Amit egy csúcskategóriás modell tud, azt egyszer tanulta meg a betanítás során, majd elmentették. Ezt követően egy zseniális fosszíliává válik. Képes köröket futni az ember körül az adatkieséséig terjedő eseményekről, majd teljesen üres fejjel áll a múlt kedd eseményei előtt. (TheSequence)

Behrouz, Hashemi és Mirrokni, a Google és a Cornell kutatói új tanulmányukban elnevezték ezt az állapotot anterográd amnéziának. Az anterográd amnéziában szenvedő beteg minden, a sérülés előtti emléket megőriz, és képes a pillanatnyi beszélgetést fenntartani, de semmi új nem jut be a hosszú távú tárolóba. Minden napot úgy él meg, mintha az első lenne. Ha a „sérülést” a „pre-training vége” szavakkal helyettesítjük, pontosan ez a Transformer-memória alakja. Megvan a mély múlt (az MLP súlyok) és a közvetlen jelen (az attention cache), és szinte semmi sem köti össze őket.

Kapcsolódó: LLM tagadáskezelés

A nyelvi modellek korlátai

A kutatók szerint hiányzik egy lépés, amelyet a biológia már régen kitalált: az alvás. Jelenleg a modellek nem képesek új információkat megjegyezni a betanítás befejezése után, ami azt jelenti, hogy a kontextusablakba betöltött új tények az ülés végén elpárolognak.

Kapcsolódó: neuronok eltávolítása

A jövőbeli fejlesztések iránya

Ez a probléma arra utal, hogy a jelenlegi tréning-teszt felosztás elavulttá válik. A Google és a Cornell kutatói a Transformer modell továbbfejlesztésén dolgoznak, hogy a modellek képesek legyenek új információkat tanulni és megjegyezni a betanítás befejezése után is, a Google Transformer modelljének frissítése 2026-ra várható.

Kapcsolódó: HORIZON teljesítményteszt

Forrás

Feldolgozott sajtóforrás·TheSequence

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom