Deep Reinforcement Learning pro karetní hru Dominion

Název práce: Deep Reinforcement Learning for the Card Game Dominion
Autor(ka) práce: Kolomazník, Vojtěch
Typ práce: Bachelor thesis
Vedoucí práce: Zamazal, Ondřej
Oponenti práce: Máša, Petr
Jazyk práce: English
Abstrakt:
This thesis aims to propose an approach using deep reinforcement learning (deep RL) for the card game Dominion. Existing deep RL approaches are studied and compared, so that a deep RL agent can be implemented. After that, the thesis attempts to determine whether a properly trained agent can perform above the level of a simple heuristic, find out which adjustments allow the agent to perform better in a partially observable environment and study the choices made by the agent. Dominion is a deck-building card game, which presents many challenges to the RL community. It violates the Markov property because the state is not fully observable to the agent. Moreover, there is inherent stochasticity because the agent’s deck gets shuffled between turns. Current academic research has attempted to apply deep Q-networks and policy gradients to solve the game with varying success. One of the biggest unanswered questions relates to the calculation of the rewards. Both Monte Carlo and temporal-difference methods yield sufficient performance in different scenarios. For the purpose of this thesis, several modifications were added to decrease the complexity of the problem. The selection of cards used in the game was frozen between games and the action phase of an agent’s turn was handled with a heuristic. Only the buying phase was controlled directly by the agent. For this thesis, REINFORCE method relying on policy gradients and Monte Carlo returns displayed superior performance compared to deep Q-networks and actor-critic architectures using temporal-difference returns. It obtained a 95 percent win rate against Big Money heuristic and an 88 percent win rate against Smithy heuristic after only 20 thousand simulated games.
Klíčová slova: reinforcement learning; neural networks; markov decision process
Název práce: Deep Reinforcement Learning pro karetní hru Dominion
Autor(ka) práce: Kolomazník, Vojtěch
Typ práce: Bakalářská práce
Vedoucí práce: Zamazal, Ondřej
Oponenti práce: Máša, Petr
Jazyk práce: English
Abstrakt:
Tato bakalářská práce si klade za cíl navrhnout přístup využívající deep reinforcement learning (deep RL) pro karetní hru Dominion. Pro implementaci vlastního přístupu jsou analyzovány a porovnány existující deep RL řešení. Následně se tato práce snaží zjistit, zda dokáže správně natrénovaný agent překonat úroveň jednoduché heuristiky, identifikovat, jaké úpravy mu umožní dosahovat lepších výkonů v částečně pozorovatelném prostředí (partially observable environment) a vyhodnotit rozhodnutí, které agent v průběhu hry dělá. Dominion je karetní hra založená na deck-building mechanice, která vytváří řadu výzev pro RL komunitu. Porušuje Markovovu vlastnost (Markov property) protože agent nezná plný stav svého prostředí. Kromě toho je ve hře přirozená nádhodnost, jelikož se balíček karet hráče mezi koly míchá. Existující výzkum aplikoval deep Q-networks a policy gradients pro řešení této hry s proměnlivým úspěchem. Jednou z největších nezodpovězených otázek je způsob výpočtu odměn. Jak Monte Carlo metody, tak metody založené na temporal-difference dosahují v různých situací dostatečného výkonu. Pro účely této práce bylo provedeno několik úprav za účelem snížení složitosti problému. Výběr karet používaných ve hře byl zafixován a action phase během tahu agenta byla řešena pomocí heuristiky. Agent tedy přímo ovládal pouze kupování karet během buying phase. V rámci této práce dosáhla metoda REINFORCE, která využívá policy gradients a metody Monte Carlo, lepšího výkonu ve srovnání s deep Q-networks a architekturami actor-critic využívajícími metody temporal-difference. Po pouhých 20 tisících simulovaných hrách agent dosáhl 95% úspěšnosti proti heuristice Big Money a 88% úspěšnosti proti heuristice Smithy.
Klíčová slova: Markovův rozhodovací proces; reinforcement learning; neuronové sítě

Informace o studiu

Studijní program / obor: Data Analytics
Typ studijního programu: Bakalářský studijní program
Přidělovaná hodnost: Bc.
Instituce přidělující hodnost: Vysoká škola ekonomická v Praze
Fakulta: Fakulta informatiky a statistiky
Katedra: Katedra informačního a znalostního inženýrství

Informace o odevzdání a obhajobě

Datum zadání práce: 3. 12. 2024
Datum podání práce: 12. 5. 2025
Datum obhajoby: 16. 6. 2025
Identifikátor v systému InSIS: https://insis.vse.cz/zp/90633/podrobnosti

Soubory ke stažení

    Poslední aktualizace: