ÉlőUtoljára: 7 perceMa: 0
Kutatásfrissítve: 09:50

A matematikai okoskodásban zárkózik fel a Sliding-Window Attention az új SWARR-ral

A kutatók által kidolgozott SWARR (Sliding-Window Attention with Reinforced Adaptation for Math Reasoning) recept jelentősen csökkenti a Sliding-Window Attention és a hagyományos self-attention közötti különbséget a matematikai feladatok megoldásában.

A matematikai okoskodásban zárkózik fel a Sliding-Window Attention az új SWARR-ral
Fotó: Indra Projects / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

Az egyre komplexebb feladatokat végző AI-modellek iránti igény megnövelte a hosszú szövegek feldolgozásának szükségességét. A hagyományos self-attention (SA) mechanizmus azonban négyzetesen skálázódik a kontextus hosszával, ami lassítja a rendszereket. Ezt a problémát igyekszik orvosolni az SWARR nevű új recept – közölte az arXiv. (ArXiv AI)

Kétfázisú adaptáció

Az SWARR két fő lépésből áll: először egy előre betanított SA-modellből alakítanak át SWA-modellt felügyelt finomhangolással (SFT). Ezután reinforcement learning (RL) segítségével tovább adaptálják a modell politikáját. A kutatók szerint az SFT után az SWA még mindig alulmarad az SA-hoz képest, ami adat-architektúra eltérésre utalhat: az SFT-adatok gyakran hosszú távú függőségeket tartalmaznak, amelyeket az SWA nehezebben modellez. Az RL-alapú adaptáció azonban lehetővé teszi, hogy a modell jobban illeszkedjen az SWA korlátaihoz.

Kapcsolódó: APMPO rendszer

Javuló eredmények

A matematikai érvelési benchmarkokon végzett kísérletek azt mutatják, hogy az SWARR recept jelentősen csökkenti az SWA és az SA közötti különbséget. A módszer nagyrészt helyreállítja az SWA konverzió során elveszett pontosságot, miközben megőrzi a lineáris komplexitású attention hatékonysági előnyeit. Az eredmények alapján az RL alapvetően megváltoztatja az SWA matematikai feladatokban való életképességéről alkotott képet.

Kapcsolódó: LLM szívverés

A kutatás eredményei az arXiv-en, az SWARR cikkben érhetők el.

Kapcsolódó: LLM mint bíró

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom