Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. QUATRO: Query-Adaptive Trust Region Policy Optimization for LLM Fine-tuning

    Feb 4, 2026Doyeon Lee, Eunyi Lyou, Hyunsoo Cho +3RL for Language Model ReasoningPolicy Optimization

  2. R2^2PO: Decoupling Rollout and Inference Policies for LLM Reasoning

    Jan 17, 2026Jingchu Wang, Bingbing Xu, Yige Yuan +4RL for Language Model ReasoningPolicy Optimization

  3. Soft Fitted Q-Iteration without Bellman Completeness: Occupancy Reweighting and Temperature Annealing

    Dec 30, 2025Lars van der Laan, Nathan KallusReinforcement LearningKL-Regularized RL

  4. SB-TRPO: Towards Safe Reinforcement Learning with Hard Constraints

    Dec 29, 2025Dominik Wagner, Ankit Kanwar, Luke OngSafety-Critical ControlPolicy Optimization

  5. Trust Region Masking for Long-Horizon LLM Reinforcement Learning

    Dec 28, 2025Yingru Li, Jiacai Liu, Jiawei Xu +4RL for Language ModelsReinforcement Learning

  6. Diffusion-Augmented Markov Decision Processes for Maximum Entropy Reinforcement Learning

    Dec 1, 2025Sebastian Sanokowski, Kaustubh Patil, Majid KhadivRL ControlDiffusion Policy

  7. Learning to Reason Efficiently with Discounted Reinforcement Learning

    Oct 27, 2025Alex Ayoub, Kavosh Asadi, Dale Schuurmans +2Reinforcement LearningRL for Language Model Reasoning

  8. Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective

    Oct 16, 2025Shiqi Chen, Tongyao Zhu, Zian Wang +8RL ExplorationPolicy Learning

  9. Frictional Q-Learning

    Sep 24, 2025Hyunwoo Kim, Hyo Kyung LeeReinforcement LearningQ-Learning

  10. Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning

    Jun 8, 2025Yang Xu, Swetha Ganesh, Vaneet AggarwalRobust Markov Decision ProcessesReinforcement Learning

  11. Fully Offline Reinforcement Learning

    May 28, 2025Mattie Fellows, Clarisse Wibault, Uljad Berdica +3Bayesian RLOffline RL

  12. Distributionally Robust Deep Q-Learning

    May 25, 2025Chung I Lu, Julian Sester, Aijia ZhangRobust Markov Decision ProcessesDeep Q-Learning

  13. Meta-reinforcement learning with minimum attention

    May 22, 2025Shashank Gupta, Pilhwa LeeMeta-Reinforcement LearningPolicy Learning

  14. Adaptive Resolving Methods for Markov Decision Processes with Function Approximations

    May 17, 2025Jiashuo Jiang, Yinyu Ye, Yiming ZongMarkov Decision ProcessesReinforcement Learning

  15. Rethinking the Global Convergence of Softmax Policy Gradient with Linear Function Approximation: The Case of Multi-Armed Bandits

    May 6, 2025Max Qiushi Lin, Jincheng Mei, Matin Aghaei +6Multi-Armed BanditsPolicy Gradient

  16. ACT-JEPA: Novel Joint-Embedding Predictive Architecture for Efficient Policy Representation Learning

    Jan 24, 2025Aleksandar Vujinovic, Aleksandar KovacevicRepresentation LearningWorld Model Learning

  17. Streaming Deep Reinforcement Learning Finally Works

    Oct 18, 2024Mohamed Elsayed, Elena Sorina Lupu, Gautham Vasan +1Reinforcement LearningActor-Critic Methods

  18. Training on Irrelevant States Implies Data Augmentation: Generalization in Contextual MDPs

    Oct 4, 2024Max Weltevrede, Caroline Horsch, Matthijs T. J. Spaan +1Reinforcement LearningRL Exploration

  19. Provably Efficient Off-Policy Adversarial Imitation Learning with Convergence Guarantees

    May 26, 2024Yilei Chen, Vittorio Giammarino, James Queeney +1Adversarial Imitation LearningImitation Learning

  20. Policy Learning with a Language Bottleneck

    May 7, 2024Megha Srivastava, Cedric Colas, Dorsa Sadigh +1Policy LearningLLM-Guided RL

  21. Topology-Guided Modular Actor-Critic Learning for Continuous Systems under Temporal Objectives

    Apr 20, 2023Lening Li, Zhentian Qian, Jianan Xia +7RL ControlReinforcement Learning

  22. Policy design in experiments with unknown interference

    Nov 16, 2020Davide Viviano, Jess RudderCausal Effect EstimationPolicy Optimization