Kétmilliárdos AI-modell lett a második legjobb a Playpen játékokban
Az Alibaba Qwen-GuidePlay-2B nevű, kétmilliárd paraméteres AI-modellje 57,12-es clemscore-t és 42,68-as statscore-t ért el a Playpen játékok validációs adathalmazán.

A fejlesztők háromlépcsős finomhangolási eljárást alkalmaztak: először sikeres játékmenetekből származó adatokkal végeztek felügyelt finomhangolást (SFT), majd súlyozott, körönkénti SFT-t, végül pedig tanár által vezérelt SFT-t. (ArXiv NLP)
A képzési módszer részletei
A nagyobb tanár modell csak a formázás javítására és az értékelési példák ellenőrzésére szolgált, nem hozott létre új, arany standard cselekvéseket. Az eredmények azt mutatják, hogy a teljes játékmenetek utánzása segíti a játszhatóságot, míg a körönkénti és a tanár által vezérelt képzés javítja a döntéshozatali képességet és növeli az általános pontszámot. A procedurálisan nehéz megközelítések, mint a replay-repair és a hard-example mining, nem hoztak érdemi javulást.
Eredmények és elérhetőség
Az Alibaba közlése szerint ez arra utal, hogy a kis modellek is képesek erős eredményeket elérni gondos adatválogatással, agresszív tréningtrükkök nélkül. A modell és a hozzá tartozó kód nyilvánosan elérhetővé vált a reprodukálhatóság érdekében.