ÉlőUtoljára: az iméntMa: 3
Kutatásfrissítve: 00:15

Szuperemberi AI verte a Stratego-világbajnokot kevesebb mint 8000 dollárból

Az Ataraxos nevű AI 15 győzelemmel, 1 vereséggel és 4 döntetlennel zárt egy 20 partiból álló sorozatot Pim Niemeijer, a Stratego legtöbb címet szerző játékosa ellen.

Szuperemberi AI verte a Stratego-világbajnokot kevesebb mint 8000 dollárból
Fotó: Christopher Paul High / Unsplash
forrás: The Decoder·AI Forradalom szerk.·
Megosztás

Egy Carnegie Mellon, NYU, Stanford és MIT kutatóiból álló csapat által fejlesztett Ataraxos nevű AI szuperemberi teljesítményt ért el a Stratego nevű társasjátékban. A szerzők tudomása szerint ez az első olyan AI, amely ilyen eredményt ért el a játékban. A tréning költsége kevesebb mint 8000 dollárra becsülték. (The Decoder)

A mérkőzés eredményei és a kihívó profilja

A 20 partiból álló hivatalos mérkőzésen az Ataraxos 15 győzelmet, 1 vereséget és 4 döntetlent ért el Pim Niemeijer ellen, akit a játék történetének legsikeresebb játékosaként tartanak számon. Niemeijer négyszeres világbajnok, 15-szeres holland bajnok és két online világbajnokságot is megnyert, több mint 600 hetet töltött a világranglista élén.

A Stratego különösen nehéz tesztet jelent az AI-k számára, mivel a játékosok mindketten 40 darabjukat lefordítva helyezik el a táblán, így több mint 10^33 lehetséges felállás létezik. A játékban a lépés értéke nemcsak a jövőbeli játékmenettől függ, hanem attól is, hogy mi történt korábban. A darabok rangja csak akkor derül ki, amikor egy ellenféllel találkoznak. A játék célja az ellenséges zászló elfoglalása.

Költséghatékonyság és tanulási módszer

Korábban a DeepMind DeepNash rendszere nem tudta felülmúlni a legjobb emberi játékosokat a Stratego-ban. A kutatók becslése szerint a DeepNash tréningje 1024 TPU csomóponton, 2-3 hónapon át tartott, ami 3-4,5 millió dolláros költséget jelentene. Ezzel szemben az Ataraxosnak egy hét kellett 16 Nvidia H100 GPU-n, majd további négy nap négy GPU-n a „belief network” nevű komponenshez. Ez kevesebb mint 8000 dollárba került, ami nagyjából az 1/500-a a számítási költségnek, az 1/30-a a self-play játékoknak és az 1/100-a a tréning adatoknak.

Az Ataraxos emberi adatok nélkül, kizárólag önmagával játszva tanult. A kulcs a játékmenet változatosságának kikényszerítése volt a tréning során, egyfajta regularizációval, amely megakadályozza, hogy a rendszer egyetlen stratégiába merevedjen bele. Ez azért fontos, mert a Stratego erős játékához sok véletlenszerűségre van szükség, és a kiszámítható játékosok könnyen kihasználhatók.

A kutatók a Niemeijer elleni sorozatot három hétre osztották el, hogy elkerüljék a fáradtságot és időt adjanak a felkészülésre. Niemeijer tudta, hogy az AI nem fog alkalmazkodni az ő stílusához, de pénzdíjat kapott a részvételért és minden győzelemért, illetve döntetlenért, így a legjobb tudása szerint játszott. Az AI 85%-os effektív nyerési aránya (a döntetleneket fél győzelemnek számítva) példátlan a legmagasabb szinten.

A kutatók ugyanazt a módszert alkalmazták más játékokban is. A Barrage Stratego variánsban az AI négy 50 partiból álló sorozatot nyert három top játékos ellen. A Hanabi kártyajátékban új rekordokat állított fel minden variánsban, a Dou dizhu kínai kártyajátékban pedig legyőzte a korábbi teljesítményteszt rendszereket.

A kutatók szerint ez azt jelenti, hogy a nagymértékben rejtett információval rendelkező játékok sem jelentenek akadályt a megerősítéses tanulás és a keresési algoritmusok számára, ami új lehetőségeket nyithat meg olyan területeken, mint a pénzügyi piacok, katonai konfliktusok és tárgyalások. A Hanabi kártyajátékban az AI minden variánsban új rekordokat állított fel.

Forrás

Feldolgozott sajtóforrás·The Decoder

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

☕ Támogatom