A matematikai okoskodásban zárkózik fel a Sliding-Window Attention az új SWARR-ral
A kutatók által kidolgozott SWARR (Sliding-Window Attention with Reinforced Adaptation for Math Reasoning) recept jelentősen csökkenti a Sliding-Window Attention és a hagyományos self-attention közötti különbséget a matematikai feladatok megoldásában.

Az egyre komplexebb feladatokat végző AI-modellek iránti igény megnövelte a hosszú szövegek feldolgozásának szükségességét. A hagyományos self-attention (SA) mechanizmus azonban négyzetesen skálázódik a kontextus hosszával, ami lassítja a rendszereket. Ezt a problémát igyekszik orvosolni az SWARR nevű új recept – közölte az arXiv. (ArXiv AI)
Kétfázisú adaptáció
Az SWARR két fő lépésből áll: először egy előre betanított SA-modellből alakítanak át SWA-modellt felügyelt finomhangolással (SFT). Ezután reinforcement learning (RL) segítségével tovább adaptálják a modell politikáját. A kutatók szerint az SFT után az SWA még mindig alulmarad az SA-hoz képest, ami adat-architektúra eltérésre utalhat: az SFT-adatok gyakran hosszú távú függőségeket tartalmaznak, amelyeket az SWA nehezebben modellez. Az RL-alapú adaptáció azonban lehetővé teszi, hogy a modell jobban illeszkedjen az SWA korlátaihoz.
Kapcsolódó: APMPO rendszer
Javuló eredmények
A matematikai érvelési benchmarkokon végzett kísérletek azt mutatják, hogy az SWARR recept jelentősen csökkenti az SWA és az SA közötti különbséget. A módszer nagyrészt helyreállítja az SWA konverzió során elveszett pontosságot, miközben megőrzi a lineáris komplexitású attention hatékonysági előnyeit. Az eredmények alapján az RL alapvetően megváltoztatja az SWA matematikai feladatokban való életképességéről alkotott képet.
Kapcsolódó: LLM szívverés
A kutatás eredményei az arXiv-en, az SWARR cikkben érhetők el.
Kapcsolódó: LLM mint bíró