KL-Regularized RL

RL: Reinforcement Learning

Momentum

3 papers in the last four weeks, with none the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 36

All topics
CardsList
  1. FERPO: Forward Entropy-Regularized Policy Optimization

    Oct 1, 2026Sebastian Sanokowski, Alireza Sarmadi, Majid KhadivKL-Regularized RLPolicy Optimization

  2. A Unified and Constrained View of Regularization-Based Robust Reinforcement Learning

    Sep 14, 2026Amine Andam, Jamal Bentahar, Mustapha HedabouKL-Regularized RLAdversarial Robustness

  3. A Forward-Inverse Dynamic Game Framework for Enhanced Multi-Agent Trajectory Planning

    Aug 3, 2026Tianle Liu, Youcheng Niu, Jing Zeng +2KL-Regularized RLGame Theory

  4. Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

    Jul 31, 2026Xujun Che, Yuchen Yuan, Weida Zhao +1Reinforcement LearningKL-Regularized RL

  5. ββ-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

    Jul 30, 2026Jiawei Xu, Minghui Liu, Juzheng Zhang +2KL-Regularized RLOn-Policy Self-Distillation

  6. Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning

    Jul 29, 2026Keegan Harris, Brian W. Lee, Ian Waudby-Smith +3Reinforcement LearningKL-Regularized RL

  7. ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples

    Jul 11, 2026Kexin Huang, Junkang Wu, Jinda Lu +7Reinforcement LearningKL-Regularized RL

  8. REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation

    Jul 11, 2026Li Guo, Anas M. Tahir, Z. Jane WangRadiology Report GenerationRadiology VLMs

  9. On the Convergence of Self-Improving Online LLM Alignment

    Jun 30, 2026Xudong Wu, Pangpang Liu, Vaneet Aggarwal +1LLM AlignmentOptimization Convergence Analysis

  10. Regularized Reward-Punishment Reinforcement Learning

    Jun 26, 2026Jiexin Wang, Eiji UchibeReinforcement LearningKL-Regularized RL

  11. KLip-PPO: A per-sample KL perspective on PPO-Clip

    Jun 22, 2026Riccardo Colletti, Robin HolzingerKL-Regularized RLPolicy Gradient Methods

  12. A Unifying Lens on Reward Uncertainty in RLHF

    Jun 8, 2026Ely Hahami, Yoel Zimmermann, Ray Zhou +1Reward ModelingKL-Regularized RL

  13. Online KL-Regularized Reinforcement Learning with Function Approximation under Misspecification

    Jun 4, 2026Haoyang Hong, Zichen Wang, Quanquan Gu +1Regret Minimization in RLReinforcement Learning

  14. Trust Region Q Adjoint Matching

    May 26, 2026Yonghoon Dong, Kyungmin Lee, Changyeon Kim +2Reinforcement LearningKL-Regularized RL

  15. Extreme Region Policy Distillation

    May 25, 2026Changyu Chen, Xiting Wang, Rui YanKL-Regularized RLRL for Language Model Reasoning

  16. How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis

    May 23, 2026Rei Higuchi, Ryotaro Kawata, Akifumi Wachi +3Reward ModelingRepresentation Learning

  17. Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework

    May 21, 2026Shourov Joarder, Diganta Sikdar, Ahsan Habib Akash +2Multi-Objective Reinforcement LearningIntrinsic Reward Methods

  18. Beyond Mode Collapse: Distribution Matching for Diverse Reasoning

    May 19, 2026Xiaozhe Li, Yang Li, Xinyu Fang +10KL-Regularized RLRL for Language Model Reasoning

  19. Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era

    May 17, 2026Qiuhe Hong, Yuyang Liu, Shuo Yang +3KL-Regularized RLContinual Learning

  20. Offline Two-Player Zero-Sum Markov Games with KL Regularization

    May 13, 2026Claire Chen, Yuheng Zhang, Xinyu Liu +3Nash EquilibriumReinforcement Learning

  21. Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability

    May 9, 2026Qingyue Zhao, Kaixuan Ji, Heyang Zhao +1KL-Regularized RLContextual Bandits

  22. Theoretical Limits of Language Model Alignment

    May 8, 2026Lucas Monteiro Paes, Natalie Mackraz, Barry-John Theobald +1Reward HackingLLM Alignment