K-5 tananyagon alapuló AI-modellek nem tudnak túllépni az általános iskolai szinten
Az 5. osztályig szűrt adatokon betanított AI-modellek nem képesek túllépni a tananyag korlátait, még skálázással vagy finomhangolással sem — derül ki egy új kutatásból.

A LittleLearner projekt keretében a kutatók egy 88 milliárd tokenből álló, csak az amerikai általános iskolák (K-5) tananyagára szűrt adathalmazon végeztek kísérleteket. Az így betanított modellek nem tudnak túllépni ezen a tudáshatáron, ami azt jelzi, hogy a betanítási folyamat korlátai meghatározzák a modell végső képességeit.
A tudáshatár szerepe
A modern nyelvi modelleket (LM) gyakran hatalmas, mindenre kiterjedő adathalmazokon tanítják, ami megnehezíti annak megállapítását, hogy egy új képesség valóban elsajátításra került-e, vagy csak a meglévő tudás „kibontása” eredménye. A LittleLearner projekt célja éppen ennek a kérdésnek a tisztázása volt.
A kutatók, köztük Fanfei Li, Jana Zeller és Ryan Cotterell, három különböző méretű (0,6B, 1,3B és 5B paraméteres) modellt tanítottak az úgynevezett LittleCurriculum adathalmazra, amely kifejezetten az elemi iskolai tananyagot tartalmazza, és minden 5. osztály fölötti anyagot kizár. Ezeket a modelleket összehasonlították egy „szűretlen kontroll” változattal is, amely ugyanolyan architektúrán alapult, de általános adathalmazon futott.
Skálázás és finomhangolás hatása
A kísérletek kimutatták, hogy a modell méretének növelése (skálázás) javítja a teljesítményt a tananyag keretein belül, és mérsékelten kiterjeszti a hasonló tanulási pályán lévő problémákra. Azonban kevés javulást eredményezett olyan feladatoknál, amelyek fejlettebb képességeket igényelnének a tananyag határain túl.
Hasonlóképpen, a finomhangolás (SFT+GRPO) és az in-context learning (kontextusból való tanulás) is csak a tananyagban szereplő képességeket erősítette, de nem tudta növelni a tananyagon kívüli teljesítményt. Ez utóbbi eredményt a kutatók, köztük Thaddäus Wiedemer is, a betanítási szűrő által meghatározott „hatékony képesség-plafonnak” tulajdonítják.
Kutatási irányok és elérhetőség
A projekt lehetővé teszi a kutatók számára, hogy kontrollált körülmények között vizsgálják az AI-tanulás különböző aspektusait. Izgalmas irányok közé tartozik a megerősítéses tanulás (RL) és a felfedezés szerepének vizsgálata: vajon az RL képes-e új képességeket létrehozni a szigorúan korlátozott tananyag mellett?
Emellett a folyamatos tanulás (continual learning) vizsgálata is cél, például negatív számok bevezetésével és a tanulási hatékonyság mérésével. A kutatók a gépi és a gyermek-tanulók összehasonlítására is alkalmasnak tartják a rendszert, hogy megértsék, hasonló expozícióra van-e szükségük a fogalmak elsajátításához, és hasonló hibákat követnek-e el.
A LittleLearner 5B-os modellje jelenleg is kipróbálható böngészőben a littlelearner-ll.github.io oldalon.