Szegmentált jutalmazással javítják a hosszú szöveges válaszokat a kutatók
A kutatók az SD-GRPO módszerrel 3 különböző feladaton, köztük a DOCCI-teszten értek el jobb eredményeket, mint a GRPO alapmodell.

Az arXiv kutatói új módszert, a SD-GRPO-t (Segment-Decomposed GRPO) dolgozták ki a hosszú, képekhez kapcsolódó szöveges válaszok generálásának javítására. A korábbi GRPO-alapú modellek egységesen értékelték a teljes válaszokat, ami nem volt optimális a vizuális-nyelvi (VL) feladatoknál, ahol a válaszok gyakran több részből állnak és gazdag szemantikai tartalommal bírnak. (ArXiv CV)
Szegmentált jutalmazás a jobb megértésért
Az SD-GRPO kihasználja a hosszú szöveges válaszok természetes szegmentáltságát. Ahelyett, hogy egyetlen skalár előnyt rendelne az egész válaszhoz, a módszer az egyes szegmensekre vonatkozó jutalmakat normalizálja. Ez egy vektornyi, szegmensspecifikus előnyt eredményez, ami pontosabb visszajelzést ad a modellnek.
Kapcsolódó: GROW-módszer
Eredmények a tesztek során
A fejlesztők három különböző feladaton tesztelték a SD-GRPO-t. Egy kontrollált, többpanelből álló, sűrű képleírást igénylő DOCCI-teszten az SD-GRPO következetesen felülmúlta a GRPO alapmodellt, különösen magasabb szegmensszámok esetén. Egy másik, a MultiChartQA-ból származó, több ábrát tartalmazó kérdés-válasz feladaton kimutatták, hogy a hosszú válaszoknál a teljes válasz értékelése pontatlanabb lehet a szegmensek közötti téves kredit-hozzáírás miatt.
Kapcsolódó: GCPO modell
Valós idejű alkalmazások
A valós idejű tudományos ábrák feliratozására irányuló MMSci adathalmazon végzett kísérletek azt mutatták, hogy bár a szegmensspecifikus normalizálás önmagában nem elegendő az összefonódó szegmensek esetén, a holisztikus és szegmensspecifikus jutalmak kombinálása tovább javította az eredményeket. Az SD-GRPO integrálható a meglévő GRPO-keretrendszerekbe, mint amilyen a Dr. GRPO is, és a kutatás előnyomtatott formában érhető el az arXiv-on, ahol a DOCCI-teszten elért eredmények is megtalálhatók.
Kapcsolódó: GroupDPO optimalizálás