ÉlőUtoljára: 12 perceMa: 9
Modellek & LLMfrissítve: 12:16

Kétmilliárdos AI-modell lett a második legjobb a Playpen játékokban

Az Alibaba Qwen-GuidePlay-2B nevű, kétmilliárd paraméteres AI-modellje 57,12-es clemscore-t és 42,68-as statscore-t ért el a Playpen játékok validációs adathalmazán.

Kétmilliárdos AI-modell lett a második legjobb a Playpen játékokban
Fotó: Growtika / Unsplash
forrás: ArXiv NLP·AI Forradalom szerk.·
Megosztás

A fejlesztők háromlépcsős finomhangolási eljárást alkalmaztak: először sikeres játékmenetekből származó adatokkal végeztek felügyelt finomhangolást (SFT), majd súlyozott, körönkénti SFT-t, végül pedig tanár által vezérelt SFT-t. (ArXiv NLP)

A képzési módszer részletei

A nagyobb tanár modell csak a formázás javítására és az értékelési példák ellenőrzésére szolgált, nem hozott létre új, arany standard cselekvéseket. Az eredmények azt mutatják, hogy a teljes játékmenetek utánzása segíti a játszhatóságot, míg a körönkénti és a tanár által vezérelt képzés javítja a döntéshozatali képességet és növeli az általános pontszámot. A procedurálisan nehéz megközelítések, mint a replay-repair és a hard-example mining, nem hoztak érdemi javulást.

Eredmények és elérhetőség

Az Alibaba közlése szerint ez arra utal, hogy a kis modellek is képesek erős eredményeket elérni gondos adatválogatással, agresszív tréningtrükkök nélkül. A modell és a hozzá tartozó kód nyilvánosan elérhetővé vált a reprodukálhatóság érdekében.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom