Markov Decision Processes

Latest papers 116

All topics
CardsList
  1. Closing the Horizon Gap in Policy Optimization for Adversarial MDPs

    Oct 8, 2026Mingyi Li, Taira TsuchiyaRegret Minimization in RLMarkov Decision Processes

  2. Toward Optimal Regret in Adversarial MDPs with Stochastic Hard Constraints

    Oct 8, 2026Qian Zuo, Francesco Emanuele StradiMarkov Decision ProcessesConstrained RL

  3. Policy Synthesis for Finite Populations of MDP Agents under Aggregate Reach-Avoid Chance Constraints

    Oct 8, 2026Jie Fu, Anamika DubeyMulti-Agent ControlMarkov Decision Processes

  4. Average-Reward Reinforcement Learning for Multichain MDPs: A Hierarchical Decomposition Approach

    Oct 7, 2026Huizhen Yu, Isaiah HeidtMarkov Decision ProcessesAverage-Reward RL

  5. Decision-Focused Learning in MDPs: An Occupancy Measure Approach

    Oct 6, 2026Zihao Zhao, Ashwath K. Karunakaram, Ali Eshragh +2Markov Decision ProcessesDecision-Focused Learning

  6. Taylor Representations for Model-Free RL in Networked MDPs

    Oct 4, 2026Salah Chikhi, Abdelhaq Chaoui, Asuman Ozdaglar +1Markov Decision ProcessesRepresentation Learning for RL

  7. Linear Programming Representations and Strongly Polynomial Algorithms for Robust Markov Decision Processes

    Oct 1, 2026Han Zhong, Yinyu YeRobust Markov Decision ProcessesMarkov Decision Processes

  8. Q-Learning for Reachability in MEC-Free MDPs

    Oct 1, 2026Lu-Chin Chang, Suguman BansalMarkov Decision ProcessesReinforcement Learning

  9. Towards Optimal Policy Improvement

    Oct 1, 2026Yaniv Oren, Viliam Vadocz, Wiktor Zabka +7Markov Decision ProcessesPolicy Optimization

  10. Rate-Optimal Algorithm for Adversarial Linear CMDPs

    Oct 1, 2026Kihyun Yu, Honghao Wei, Dabeen LeeRegret Minimization in RLMarkov Decision Processes

  11. Policy Iteration Is Not Strongly Polynomial for Deterministic Markov Decision Processes: The Price of Algorithmic Anarchy

    Sep 30, 2026Han Zhong, Yinyu YeMarkov Decision ProcessesPolicy Iteration

  12. Fast Regularized Policy Mirror Descent with One-Step TD Updates

    Sep 30, 2026Qipei Chen, Wenye Li, Yule Sun +1Markov Decision ProcessesPolicy Optimization

  13. Learning Infinite-Horizon Average-Reward CMDPs via State Augmentation

    Sep 30, 2026Kihyun Yu, Seoungbin Bae, Dabeen LeeRegret Minimization in RLMarkov Decision Processes

  14. Vector Bellman Theory for Multichain Robust Average-Reward Markov Decision Processes

    Sep 23, 2026Yue Wang, George AtiaRobust Markov Decision ProcessesMarkov Decision Processes

  15. A Decentralized Partially Observable Team Decision Methodology with Delayed Information Sharing

    Sep 22, 2026Xiaoxing Ren, Thomas Parisini, Andreas A. MalikopoulosMarkov Decision ProcessesLinear Markov Decision Processes

  16. Reinforcement Learning under State and Outcome Uncertainty: A Foundational Distributional Perspective

    Sep 21, 2026Larry Preuett, Qiuyi Zhang, Muhammad Aurangzeb AhmadDistributional RLMarkov Decision Processes

  17. Graph-Based Stochastic Power-UCT: Monte-Carlo Graph Search with Power Mean Estimation

    Sep 17, 2026Tung Tran, Viet Bao Mai, Hoang Ta +1Markov Decision ProcessesMonte Carlo Tree Search

  18. Strong and Compact Policies for Submodular Markov Decision Processes via LP-Based Submodular Orienteering

    Sep 14, 2026Lars Rohwedder, Rico ZenklusenSubmodular OptimizationMarkov Decision Processes

  19. Windowed A-K-MDP

    Sep 12, 2026Xiangwen Yang, Frankie Cho, Iadine ChadesMarkov Decision ProcessesMarkov Models

  20. Supermartingale Certificates for Parametric MDPs

    Sep 11, 2026Kaushik Mallik, Ðorđe ŽikelićRobust Markov Decision ProcessesMarkov Decision Processes

  21. Boundary-Seeking Policy Gradient for Safe Reinforcement Learning

    Aug 10, 2026Chenhua Fan, Jiahui Zhu, Yuhang Zhang +1Markov Decision ProcessesConstrained RL

  22. Path-dependent Discrete Amortized Inference

    Aug 9, 2026Tiago da Silva, Esmeralda S. Whitammer, Salem LahlouMarkov Decision ProcessesLatent Dynamics Modeling

  23. Finite Constant Frontiers and Auditable Regret Certificates for Average-Reward Reinforcement Learning

    Aug 7, 2026Ibne Farabi Shihab, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus SwaqeebRegret Minimization in RLMarkov Decision Processes

  24. Sub-Quadratic Bisimulation Metrics via Approximate Nearest Neighbors: Coverage-Augmented Guarantees and Computable Two-Sided Certificates

    Aug 7, 2026Ibne Farabi Shihab, Joyanta Jyoti MondalMarkov Decision ProcessesApproximation Algorithms

  25. Stochasticity Is Not the Hard Part: Reduction and Complexity in Instructional Sequencing over Prerequisite DAGs

    Aug 5, 2026Zonglin Han, Yichen Chen, Jiawen Jiang +2Markov Decision ProcessesEducational Technology

  26. Optimal Constrained sc-LTL Planning in MDPs via Switching Policies

    Aug 5, 2026Zetong Xuan, Yu WangMarkov Decision ProcessesLinear Temporal Logic

  27. Robust Counterfactual Policy Optimisation via Nondeterministic Causal Models

    Aug 3, 2026Jessica Lally, Milad Kazemi, Nicola Paoletti +2Markov Decision ProcessesStructural Causal Models