Maximum Entropy RL

RL: Reinforcement Learning

Momentum

6 papers in the last four weeks, with none the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 45

All topics
CardsList
  1. LASER: Latent Space Adjoint Matching for Support-Constrained Entropy-Regularized Offline RL

    Oct 6, 2026Songyuan Zhang, Oswin So, Eric Yang Yu +3Reinforcement LearningOffline RL

  2. FERPO: Forward Entropy-Regularized Policy Optimization

    Oct 1, 2026Sebastian Sanokowski, Alireza Sarmadi, Majid KhadivKL-Regularized RLPolicy Optimization

  3. An analysis of Mirror-Descent Soft Actor-Critic

    Sep 28, 2026Denis Zorba, Michal ValkoReinforcement LearningOnline Mirror Descent

  4. RLVR landscapes for iterated multiplications can be benign: Insights from spin-glass theory

    Sep 23, 2026Noa Rubin, Zohar RingelReinforcement LearningMaximum Entropy RL

  5. SCQ: Stabilizing Conservative Q-Learning with Sigmoid-Bounded Entropy

    Sep 14, 2026Xiefeng Wu, Shu Zhang, Zhaojie Chu +1Robotic RLOffline RL

  6. Learning to Solve Stochastic Controls with Unknown Drifts and Running Rewards: Theory, Algorithms and Convergence

    Sep 14, 2026Jin Ma, Gaozhan Wang, Jianfeng Zhang +1Reinforcement LearningStochastic Optimal Control

  7. Wasserstein Policy Gradient for Entropy-Regularized Linear-Quadratic Control

    Aug 7, 2026Zhaoyu Zhu, Rui Gao, Shuang LiMaximum Entropy RLPolicy Gradient Methods

  8. Distributional Soft Bellman Operator under the Cramér Geometry

    Jul 20, 2026Keru Wang, Yixin Deng, Yao Lyu +2Distributional RLMaximum Entropy RL

  9. Group Entropy-Controlled Policy Optimization

    Jul 18, 2026Guangran Cheng, Chengqi Lyu, Songyang Gao +2RL for Language ModelsGroup Relative Policy Optimization

  10. Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning

    Jul 8, 2026Zetian Hu, Shunyu Liu, Junjie Zhang +4Agentic RLGroup Relative Policy Optimization

  11. Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning

    Jul 3, 2026Jialun Cao, Fernando Acero, David Šiška +1Robust Markov Decision ProcessesMaximum Entropy RL

  12. ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy

    Jul 3, 2026Zijun Xie, Yuyang You, Yongzhi Li +6Token-Level Credit AssignmentRL for Language Model Reasoning

  13. Entropy-Regularized Reinforcement Learning for Linear-Quadratic Stackelberg Differential Games in Regime-Switching Diffusion Models

    Jun 27, 2026Congde Hu, Danping Li, Lin Xu +1Stackelberg GamesMaximum Entropy RL

  14. Entropy Regularized Reinforcement Learning for Zero-Sum Stochastic Differential Games in a Regime-Switching Jump-Diffusion Process

    Jun 27, 2026Congde Hu, Zhuo Jin, Danping Li +1Zero-Sum GamesMaximum Entropy RL

  15. Scalable Maximum Entropy Reinforcement Learning for Diffusion Policies via Adjoint Matching

    Jun 21, 2026Serge Thilges, Onur Celik, Denis Blessing +2Diffusion PolicyMaximum Entropy RL

  16. STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability

    Jun 17, 2026Haipeng Luo, Qingfeng Sun, Songli Wu +4RL for Language Model ReasoningMaximum Entropy RL

  17. Maximum Entropy Inverse Reinforcement Learning for Mean-Field Games with Average Reward

    Jun 15, 2026Şevket Kaan Alkır, Naci Saldı, Berkay Anahtarcı +1Reinforcement LearningAverage-Reward RL

  18. Mitigating Bias in Low-SNR Financial Reinforcement Learning via Quantum Representations

    Jun 9, 2026Zeyu Liu, Xuanzhi Feng, Sing Kwong Lai +6Quantitative FinanceQuantum Machine Learning

  19. PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR

    Jun 7, 2026Shumeng Yang, Yisu Liu, Jiayi Zheng +2RL for Language Model ReasoningMaximum Entropy RL

  20. Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models

    Jun 3, 2026Chirag Chawla, Rohan Charudatt Salvi, Madhav S. BaidyaReinforcement LearningRL for Language Model Reasoning

  21. FLAG: Flow Policy MaxEnt-RL by Latent Augmented Guidance

    May 29, 2026Sungha Kim, Gawon Lee, Jusuk Lee +3RL ControlMaximum Entropy RL

  22. Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning

    May 25, 2026Zhaoyu Zhu, Rui Gao, Shuang LiOptimization Convergence AnalysisWasserstein Gradient Flows

  23. Refined Analysis of Entropy-Regularized Actor-Critic

    May 23, 2026Safwan Labbi, Paul Mangold, Daniil Tiapkin +1Reinforcement LearningMaximum Entropy RL

  24. A note on convergence of Wasserstein policy optimization

    May 21, 2026David Šiška, Yufei ZhangWasserstein Gradient FlowsPolicy Optimization

  25. Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent

    May 20, 2026Zeyuan Wang, Da Li, Yulin Chen +6Reinforcement LearningMaximum Entropy RL

  26. Behavior-Consistent Deep Reinforcement Learning

    May 20, 2026Marcel Hussing, Liv G. d'Aliberti, Claas Voelcker +2Reinforcement LearningPolicy Optimization

  27. Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control

    May 12, 2026Jiazheng Zhang, Ziche Fu, Junrui Shen +17RL for Language Model ReasoningPolicy Optimization