Actor-Critic Methods

Momentum

9 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 62

All topics
CardsList
  1. A Closed-Loop Non-Asymptotic Convergence Analysis of PPO with Learned Critics and Clipping

    Oct 7, 2026Junwei Su, Mengfan Liu, Yanyong Zhang +1Proximal Policy OptimizationActor-Critic Methods

  2. Foundation Model-Aided Multi-Agent Reinforcement Learning for Wireless Random Access Network Optimization

    Oct 6, 2026Myeung Suk Oh, Zhiyao Zhang, Alvaro Velasquez +2Wireless Resource AllocationDecentralized MARL

  3. Taylor Representations for Model-Free RL in Networked MDPs

    Oct 4, 2026Salah Chikhi, Abdelhaq Chaoui, Asuman Ozdaglar +1Markov Decision ProcessesRepresentation Learning for RL

  4. Trust the Critic More

    Sep 30, 2026Kaiyue Wen, Luke Bailey, Arvind Mahankali +1RL for Language Model ReasoningCredit Assignment in RL

  5. Privy to the Foil: Recasting Value Estimation with a Self-Privileged Critic for RLVR

    Sep 29, 2026Kun Liang, Chenming Tang, Clive Bai +5Value Function EstimationRL for Language Model Reasoning

  6. A Concentration Bound for Two-Timescale Actor-Critic Algorithm

    Sep 24, 2026Prashansa Panda, Shalabh BhatnagarAverage-Reward RLTwo-Timescale Stochastic Approximation

  7. Fully Byzantine-Resilient Multi-Agent Reinforcement Learning

    Sep 22, 2026Haejoon Lee, Dimitra PanagouDecentralized MARLActor-Critic Methods

  8. CARE-VI: Conservative Adaptive Reliability Estimation for Value Improvement in Off-Policy Actor-Critic Learning

    Sep 17, 2026Xiang Zou, Shengzhu Shi, Junqi Gao +1Temporal-Difference LearningActor-Critic Methods

  9. Locally-Guided Actor-Critic: Training a Goal-conditioned Actor with a Subgoal-aware Critic

    Aug 31, 2026Olivier Serris, Stéphane Doncieux, Olivier SigaudReinforcement LearningSparse-Reward RL

  10. The Time Value of Evolution

    Aug 13, 2026Matthew Siper, Ahmed Khalifa, Julian TogeliusEvolutionary OptimizationPolicy Gradient Methods

  11. Learning Suffers More Than the Policy Class Under Partial Observability: A Closed-Form Analysis

    Aug 7, 2026Idil GözelRL ControlReinforcement Learning

  12. Toward Integrating Adaptive Experience Replay and Online Uncertainty Estimation in Safe Actor-Critic Optimal Control

    Aug 5, 2026Mahshad Rastegarmoghaddam, Davoud Nikkhouy, Shima SamadzadehRL ControlReinforcement Learning

  13. Foundations of Reinforcement Learning and Control:Connections and New Perspectives

    Aug 3, 2026Claire Vernade, Onno Eberhard, Martha White +4RL ControlData-Driven Control

  14. ReBRAC-v2: The Return of the King

    Aug 2, 2026Denis Tarasov, Robert K. KatzschmannReinforcement LearningOffline RL

  15. Hierarchical Multilevel Monte Carlo for Order-Optimal Neural Actor-Critic in Average-Reward CMDPs

    Jul 30, 2026Ankur Naskar, Vaneet AggarwalAverage-Reward RLConstrained RL

  16. Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning

    Jul 29, 2026Gong Gao, Xiao Lai, Ziqi Xie +3Reinforcement LearningActor-Critic Methods

  17. Comparative Study of Multi-Agent Actor-Critic Algorithms in Parameterized Action Reinforcement Learning

    Jul 21, 2026Ubayd Ali Bapoo, Clement N NyirendaReinforcement LearningSoft Actor-Critic

  18. Deconstructing Actor-Critic: A Large-scale Empirical Study of Design Components for Practitioners

    Jul 14, 2026Haseeb Shah, Lingwei Zhu, Adam White +1RL ControlReinforcement Learning

  19. Actor-Critic Learning for Extended Mean Field Control with Deterministic Policies

    Jul 13, 2026Ziheng Cheng, Xin Guo, Huyên Pham +1Policy GradientContinuous-Time RL

  20. Revisiting Action Factorization for Complex Action Spaces

    Jun 25, 2026Timothy Flavin, Sandip SenReinforcement LearningActor-Critic Methods

  21. Mean-Field PhiBE: Continuous-Time Mean-Field Reinforcement Learning from Discrete-Time Data

    Jun 25, 2026Erhan Bayraktar, Martin Hernandez, Qinxin Yan +1Reinforcement LearningStochastic Optimal Control

  22. Bias-Controlled Primal-Dual Natural Actor-Critic: Optimal Rates for Constrained Multi-Objective Average-Reward RL

    Jun 23, 2026Ankur Naskar, Swetha Ganesh, Vaneet AggarwalMulti-Objective Reinforcement LearningReinforcement Learning

  23. Critic Architecture Matters: Dual vs. Unified Critics for Humanoid Loco-Manipulation

    Jun 10, 2026Mehmet Turan YardımcıMulti-Objective Reinforcement LearningHumanoid Loco-Manipulation

  24. Phi-Actor-Critic: Steering General-Sum Games to Pareto-Efficient Correlated Equilibria

    Jun 9, 2026Wongyu Lee, Francesco Lelli, Omran Ayoub +1Multi-Agent CoordinationRegret Minimization