ÉlőUtoljára: 12 perceMa: 28
Kutatásfrissítve: 02:50

Szegmentált jutalmazással javítják a hosszú szöveges válaszokat a kutatók

A kutatók az SD-GRPO módszerrel 3 különböző feladaton, köztük a DOCCI-teszten értek el jobb eredményeket, mint a GRPO alapmodell.

Szegmentált jutalmazással javítják a hosszú szöveges válaszokat a kutatók
Fotó: CDC / Unsplash
forrás: ArXiv CV·AI Forradalom szerk.·
Megosztás

Az arXiv kutatói új módszert, a SD-GRPO-t (Segment-Decomposed GRPO) dolgozták ki a hosszú, képekhez kapcsolódó szöveges válaszok generálásának javítására. A korábbi GRPO-alapú modellek egységesen értékelték a teljes válaszokat, ami nem volt optimális a vizuális-nyelvi (VL) feladatoknál, ahol a válaszok gyakran több részből állnak és gazdag szemantikai tartalommal bírnak. (ArXiv CV)

Szegmentált jutalmazás a jobb megértésért

Az SD-GRPO kihasználja a hosszú szöveges válaszok természetes szegmentáltságát. Ahelyett, hogy egyetlen skalár előnyt rendelne az egész válaszhoz, a módszer az egyes szegmensekre vonatkozó jutalmakat normalizálja. Ez egy vektornyi, szegmensspecifikus előnyt eredményez, ami pontosabb visszajelzést ad a modellnek.

Kapcsolódó: GROW-módszer

Eredmények a tesztek során

A fejlesztők három különböző feladaton tesztelték a SD-GRPO-t. Egy kontrollált, többpanelből álló, sűrű képleírást igénylő DOCCI-teszten az SD-GRPO következetesen felülmúlta a GRPO alapmodellt, különösen magasabb szegmensszámok esetén. Egy másik, a MultiChartQA-ból származó, több ábrát tartalmazó kérdés-válasz feladaton kimutatták, hogy a hosszú válaszoknál a teljes válasz értékelése pontatlanabb lehet a szegmensek közötti téves kredit-hozzáírás miatt.

Kapcsolódó: GCPO modell

Valós idejű alkalmazások

A valós idejű tudományos ábrák feliratozására irányuló MMSci adathalmazon végzett kísérletek azt mutatták, hogy bár a szegmensspecifikus normalizálás önmagában nem elegendő az összefonódó szegmensek esetén, a holisztikus és szegmensspecifikus jutalmak kombinálása tovább javította az eredményeket. Az SD-GRPO integrálható a meglévő GRPO-keretrendszerekbe, mint amilyen a Dr. GRPO is, és a kutatás előnyomtatott formában érhető el az arXiv-on, ahol a DOCCI-teszten elért eredmények is megtalálhatók.

Kapcsolódó: GroupDPO optimalizálás

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom