cs.MASep 29, 2026

Regularized policy gradient with learned mixtures of Gaussians for games with continuous actions

Authors: Ondřej Kubíček, Viliam Lisý, Tuomas Sandholm

Organizations: Czech Technical University in Prague · Carnegie Mellon University · Artificial Intelligence Center

Abstract

Most successes of superhuman game-playing algorithms are in games with discrete actions, yet in auctions, robotics, sports, or trading, actions are nearly continuous. Prior techniques either rely on expert-designed discretizations or are sample inefficient. We present a scalable policy-gradient algorithm for large sequential games with continuous or mixed discrete and continuous actions. It combines magnetic mirror descent with a mixture of Gaussians reparametrization, trained via self-play. We show that it approximates equilibrium in games where gradient descent fails. In sequential games, it outperforms neural fictitious self-play and matches or outperforms the final strategies of policy space response oracles with 3.5--5.5×\times fewer samples. In heads-up no-limit Texas hold'em, it performs on par with Slumbot.

Figures & tables

Appendix figures & tables15 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Revisiting Mixture Policies in Entropy-Regularized Actor-Critic

    May 9, 2026Jiamin He, Samuel Neumann, Jincheng Mei +2Entropy Regularized Reinforcement LearningSoft Actor-Critic

  2. EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games

    Jun 22, 2026Tristan Maidment, JB Lanier, Chase McDonald +5Self-PlayImperfect-Information Games

  3. Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients

    May 14, 2026Matias Alvo, Daniel Russo, Yash KanoriaAction SpaceGradient