ÉlőUtoljára: 1 perceMa: 16
Kutatásfrissítve: 10:16

Játékokban tanult képességek pénzügyi kutatásban is jobb eredményeket hoznak

A Good Start Labs 30 milliárd paraméteres modellje az 1830: The Game of Railroads and Robber Barons nevű vasúti játékban tanult képességeket hasznosítva javított a pénzügyi kutatási feladatokon.

Játékokban tanult képességek pénzügyi kutatásban is jobb eredményeket hoznak
Fotó: CDC / Unsplash
forrás: Latent Space·AI Forradalom szerk.·
Megosztás

A játékok régóta alulértékelt oktatási eszközök, amelyek szuperül megközelíthetők és emberiek — mondja Alex Duffy, a Good Start Labs társalapító és vezérigazgatója. A cégük játékokat használ fel AI-modellek betanítására, és azt vizsgálja, hogyan befolyásolja a tanulási környezet kialakítása a modellek képességeit és azok valós munkára való átvitelét. A vállalat tavaly októberben vált ki az Every nevű AI-médiavállalatból, 3,6 millió dolláros befektetéssel General Catalyst, Inovia, Every és angyalbefektetők részéről. (Latent Space)

Az ötlet egy 2025-ös Twitch-közvetítésből származik, ahol határvonal-modellek játszották a Diplomacy nevű játékot. Duffy, aki akkoriban az Every AI-képzési vezetője volt, megfigyelte, hogy a különböző modellek eltérően reagálnak a játékhelyzetekre.

Az OpenAI o3 modellje például a jövőbeli árulás megtervezésével nyerte meg a játékokat, míg a Claude Opus 4 modellje nem volt hajlandó hazudni, és így „elpusztult”. Duffy ebből arra következtetett, hogy a Diplomacy-hez hasonló játékokon való edzés olyan készségeket taníthat az AI-knak, mint a stratégiai gondolkodás, különösen, mert ezeknek a játékoknak az eredményei ellenőrizhetők.

Későbbi cikkében Duffy azt írta, hogy a „Diplomacy stratégiai játékon való finomhangolás javította a modell teljesítményét az ügyfélszolgálati és ipari műveleti benchmarkokon”. A Good Start Labs társalapítója, Tyler Marques, a reinforcement learning környezeteket tartja az egyik legmegbízhatóbb módszernek az ellenőrizhető képességek tanítására. A fő elképzelés az, hogy a játék bemutatásának módja meghatározza, milyen készségeket tanul meg a modell, és hogy ezek a készségek átszivárognak-e a játékon kívüli munkára.

Játékból a pénzügyi kutatásba

A cég nemrégiben egy 30 milliárd paraméteres modellt tanított be a 19. századi vasúti játékba, az 1830: The Game of Railroads and Robber Barons-ba. Ezt követően ugyanazt a modellt pénzügyi kutatási feladatokon tesztelték, hogy megvizsgálják, a játékban tanult szokások átterjednek-e a játékon kívüli környezetre.

A játékban van egy tőzsdei mechanika is, ahol a játékosok vasúttársaságok részvényeire licitálnak. A teszt során a modellek adatbázisokban kerestek információt a játékmenetről, Excel fájlba helyezték, feldolgozták, funkciókat hoztak létre, majd kiszámolták a választ. Ez a folyamat tükrözi a tipikus pénzügyi munkafolyamatokat, de a játék keretein belül.

A tanulási környezet kulcsfontosságú

A közzétett eredmények összehasonlítják az egyszakaszos kérdés-válasz képzést — ahol a modell egy játéktárgyat kap, és meg kell hoznia a következő lépést — egy „többszakaszos terminálügynökkel, amely eszközöket használ a környezet felfedezésére, stratégia tervezésére és valós idejű adaptálódásra”. Bár mindkét képzési módszer javította a játékon belüli célokat, csak a terminálügynök designja javította a Finance-Agent teljesítményteszten elért teljesítményt.

Duffy szerint a Good Start Labs egy szakértői modellt is hozzáadhat, amely sűrűbb, lépésenkénti jutalmakat biztosít. A „hám” lehetővé teszi, hogy a környezet különböző módon közelítse meg ugyanazt a játékot. „Ahogy megtervezed ezt a [hámot], az teljesen megváltoztatja, mit tanulhat a modell” — mondta Duffy.

A Good Start Labs általános célja annak megértése, „hogyan tervezzünk meg egy tanulási környezetet specifikus képességek tanítására”. Ezt a kérdést vizsgálja a COS-PLAY: Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks című, Duffy és Marques által jegyzett tanulmány is, amelyben egy döntéshozó ügynök kap hozzáférést egy „tanulható készségbankhoz a cselekvés irányítására”.

A kutatók szerint a képességek átvitelének mértéke a játékokban megfigyelt kísérletekből a szélesebb valós alkalmazásokra még nem teljesen tisztázott. Az újabb, képességeiben fejlettebb modellek általában jobbak a játékokban, de a „személyiségtengelyeken” — árulás, együttműködés, elméleti gondolkodás — eltérnek egymástól. A 2026 szeptemberében közzétett rangsor szerint az Astra modell 50%-ban egyezik az emberi ítélettel az LOL-Alignment teljesítményteszten, mindössze 2%-kal előzi meg a GPT-4o-t.

Forrás

Feldolgozott sajtóforrás·Latent Space

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom