Tíz ezer mintával triplázta a pontosságot a Qwen3-VL-4B-n a PRISM eljáras
A PRISM nevű új adatgeneráló eljárás 10 000 mintával 9,5%-ról 30,1%-ra emeli a Qwen3-VL-4B modell pontosságát a komplex utasítások megértésében.

A valós idejű multimodális utasítások gyakran több, eltérő fontosságú követelményt tartalmaznak, ám a jelenlegi képzési adatok ezt nagyrészt figyelmen kívül hagyják. A kutatók ezt a hiányosságot a „rubrika megértés” tanulmányozásával próbálják orvosolni, ahol a modell nem csak válaszol egy kérdésre, hanem egy megadott, priorizált rubrikát követve ellenőrzi a szabályokat, mielőtt végleges ítéletet hozna. (ArXiv ML)
Ehhez fejlesztették ki a PRISM nevű, négylépcsős adatgeneráló keretrendszert. Ez persona–feladat párokat, előtaggal vezérelt szabálykészleteket, minőségileg szűrt rubrikákat és strukturált ellenőrzési nyomokat hoz létre. A PRISM-Eval nevű metrikarendszer pedig determinisztikus címkézést használ, így nincs szükség inference-time bíró modellre.
A mindössze 10 000 szintetizált mintával a PRISM a Qwen3-VL-4B modell Strict pontosságát 9,5%-ról 30,1%-ra emeli a PRISM-Eval teszten. Ez az átlagos teljesítmény megőrzése mellett történik, és a fejlesztők szerint a több mint 20%-os javulás más nyílt forráskódú multimodális LLM-ekre is átterjed, függetlenül azok architektúrájától.
A kutatók úgy vélik, ez a strukturált rubrikák általi felügyelet skálázható utat kínál a több szabályt és prioritást figyelembe vevő multimodális utasításkövetés felé. Az eredmények előnyomtatott formában érhetők el az arXiv-on.