1,7 milliárd paraméteres AI-modell 4 lépésben generál szöveget — az Apple kutatói szerint
Az Apple kutatói 1,7 milliárd paraméteres AI-modellt tanítottak 2,1 trillió tokenen, ami 4 lépésben képes szöveget generálni, miközben megőrizte a majdnem adatszintű token entrópiát.

A kutatás, amelyet az Oxfordi Egyetem kutatói végeztek az Apple-nél töltött idejük alatt, azt vizsgálja, hogy a folytonos diffúziós és flow-matching modellek alternatívát kínálhatnak-e az autoregresszív megközelítésekkel szemben a nyelvi modellezésben. Ezek a módszerek olyan előnyöket tesznek lehetővé, mint a gyorsabb mintavételezés és a „tilting” (döntés), amelyek korábban csak a folytonos modalitásokra voltak jellemzőek. (Apple ML)
Gyorsabb mintavételezés CFM-ekkel
A korábbi kutatások már kimutatták, hogy diszkrét adatok is generálhatók folytonos folyamatokkal, például egy Gauss-eloszlás és az one-hot kódolt adat-eloszlás közötti flow-matching segítségével. A Categorical Flow Maps (CFM) révén felgyorsított mintavételezés is megvalósítható, ami kevés lépésben is versenyképes minőséget eredményez. Az Apple kutatói által végzett munka azonban az első, amely ilyen nagy skálán, 1,7 milliárd paraméterrel és 2,1 trillió tokenen vizsgálta a módszer skálázhatóságát.
Új mérési módszer és kihívások
A kutatók egy új, valószínűségi határral (likelihood bound) rendelkező mérési módszert is bevezettek a CFM-ekre a fél-diszkrét beállításban. Ez lehetővé teszi a modellek értékelését szabványos nyelvi modellezési benchmarkokon, ahol az eredmények a diszkrét diffúziós módszerekkel összehasonlítható tartományban helyezkednek el – állítják a szerzők. A nagyméretű modellek tanítása során azonban kihívások merültek fel, amelyekre a cikk konkrét útmutatásokat ad a veszteség súlyozásával és az időbeli ütemezéssel kapcsolatban.
Az eredmények az University of Oxford kutatóinak munkáját mutatják be, akik az Apple-nél végezték kutatásaikat. A teljes tanulmány előnyomtatott formában érhető el az arXiv-on.