Játékokban tanult képességek pénzügyi kutatásban is jobb eredményeket hoznak
A Good Start Labs 30 milliárd paraméteres modellje az 1830: The Game of Railroads and Robber Barons nevű vasúti játékban tanult képességeket hasznosítva javított a pénzügyi kutatási feladatokon.

A játékok régóta alulértékelt oktatási eszközök, amelyek szuperül megközelíthetők és emberiek — mondja Alex Duffy, a Good Start Labs társalapító és vezérigazgatója. A cégük játékokat használ fel AI-modellek betanítására, és azt vizsgálja, hogyan befolyásolja a tanulási környezet kialakítása a modellek képességeit és azok valós munkára való átvitelét. A vállalat tavaly októberben vált ki az Every nevű AI-médiavállalatból, 3,6 millió dolláros befektetéssel General Catalyst, Inovia, Every és angyalbefektetők részéről. (Latent Space)
Az ötlet egy 2025-ös Twitch-közvetítésből származik, ahol határvonal-modellek játszották a Diplomacy nevű játékot. Duffy, aki akkoriban az Every AI-képzési vezetője volt, megfigyelte, hogy a különböző modellek eltérően reagálnak a játékhelyzetekre.
Az OpenAI o3 modellje például a jövőbeli árulás megtervezésével nyerte meg a játékokat, míg a Claude Opus 4 modellje nem volt hajlandó hazudni, és így „elpusztult”. Duffy ebből arra következtetett, hogy a Diplomacy-hez hasonló játékokon való edzés olyan készségeket taníthat az AI-knak, mint a stratégiai gondolkodás, különösen, mert ezeknek a játékoknak az eredményei ellenőrizhetők.
Későbbi cikkében Duffy azt írta, hogy a „Diplomacy stratégiai játékon való finomhangolás javította a modell teljesítményét az ügyfélszolgálati és ipari műveleti benchmarkokon”. A Good Start Labs társalapítója, Tyler Marques, a reinforcement learning környezeteket tartja az egyik legmegbízhatóbb módszernek az ellenőrizhető képességek tanítására. A fő elképzelés az, hogy a játék bemutatásának módja meghatározza, milyen készségeket tanul meg a modell, és hogy ezek a készségek átszivárognak-e a játékon kívüli munkára.
Játékból a pénzügyi kutatásba
A cég nemrégiben egy 30 milliárd paraméteres modellt tanított be a 19. századi vasúti játékba, az 1830: The Game of Railroads and Robber Barons-ba. Ezt követően ugyanazt a modellt pénzügyi kutatási feladatokon tesztelték, hogy megvizsgálják, a játékban tanult szokások átterjednek-e a játékon kívüli környezetre.
A játékban van egy tőzsdei mechanika is, ahol a játékosok vasúttársaságok részvényeire licitálnak. A teszt során a modellek adatbázisokban kerestek információt a játékmenetről, Excel fájlba helyezték, feldolgozták, funkciókat hoztak létre, majd kiszámolták a választ. Ez a folyamat tükrözi a tipikus pénzügyi munkafolyamatokat, de a játék keretein belül.
A tanulási környezet kulcsfontosságú
A közzétett eredmények összehasonlítják az egyszakaszos kérdés-válasz képzést — ahol a modell egy játéktárgyat kap, és meg kell hoznia a következő lépést — egy „többszakaszos terminálügynökkel, amely eszközöket használ a környezet felfedezésére, stratégia tervezésére és valós idejű adaptálódásra”. Bár mindkét képzési módszer javította a játékon belüli célokat, csak a terminálügynök designja javította a Finance-Agent teljesítményteszten elért teljesítményt.
Duffy szerint a Good Start Labs egy szakértői modellt is hozzáadhat, amely sűrűbb, lépésenkénti jutalmakat biztosít. A „hám” lehetővé teszi, hogy a környezet különböző módon közelítse meg ugyanazt a játékot. „Ahogy megtervezed ezt a [hámot], az teljesen megváltoztatja, mit tanulhat a modell” — mondta Duffy.
A Good Start Labs általános célja annak megértése, „hogyan tervezzünk meg egy tanulási környezetet specifikus képességek tanítására”. Ezt a kérdést vizsgálja a COS-PLAY: Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks című, Duffy és Marques által jegyzett tanulmány is, amelyben egy döntéshozó ügynök kap hozzáférést egy „tanulható készségbankhoz a cselekvés irányítására”.
A kutatók szerint a képességek átvitelének mértéke a játékokban megfigyelt kísérletekből a szélesebb valós alkalmazásokra még nem teljesen tisztázott. Az újabb, képességeiben fejlettebb modellek általában jobbak a játékokban, de a „személyiségtengelyeken” — árulás, együttműködés, elméleti gondolkodás — eltérnek egymástól. A 2026 szeptemberében közzétett rangsor szerint az Astra modell 50%-ban egyezik az emberi ítélettel az LOL-Alignment teljesítményteszten, mindössze 2%-kal előzi meg a GPT-4o-t.