Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. Uncertainty-Gated Exploration Noise Suppresses Task Collapse in Online RL Fine-Tuning of a Flow-Matching Vision-Language-Action Policy

    Sep 23, 2026Mehmet Turan Yardımcı, Yunus Emre ÇoğurcuRobot Policy LearningRL Exploration

  2. MimicAgent: Quadruped Skills via Prompt-to-Trajectory Generation

    Sep 21, 2026Lucky Kant Nayak, Narayanan Palghat Parameswaran, Neehar Peri +1Reinforcement LearningTrajectory Generation

  3. Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision

    Sep 17, 2026Nitish Dashora, Douglas Chen, Idan Shenfeld +3Robot Policy LearningLong-Horizon Robotic Manipulation

  4. Accelerating Visual Policy Learning with Sampling-Based Model Predictive Control

    Sep 17, 2026Yilang Liu, Haoxiang You, Qian Wang +2Policy OptimizationVisuomotor Policy Learning

  5. MATCH: Model-Aware Tool Learning with Curriculum Scheduling and Hierarchically Gated Rewards

    Sep 17, 2026Shihao Liu, Hao Yin, Lijun Liu +3Reward ModelingCurriculum RL

  6. Dual-Axis Policy Optimization for LLM Agents: Bayesian Feedback Attribution and Trajectory Mass Normalization

    Sep 17, 2026Yingxuan Zhuang, Binhe Yu, Jingxiao Yang +6Group Relative Policy OptimizationPolicy Optimization

  7. Stable Policy Learning

    Sep 16, 2026Harvey Barnhard, Giacomo Opocher, Rahul SinghAlgorithmic StabilityPolicy Learning

  8. A Convergence Framework for Deep VV-Learning: Error Propagation and Sharp Action-Gap Bounds

    Sep 16, 2026Yury KolomeytsevReinforcement LearningPolicy Learning

  9. Bellman Policy Optimization

    Sep 14, 2026Zhuoqing Song, Haotian Xu, Xikun Zhang +1Reinforcement LearningRL for Language Model Reasoning

  10. MInTRL: Off-policy Intervention can boost On-policy RL

    Sep 14, 2026Mingyu Chen, Yefan Tao, Gerald Friedland +2Reinforcement LearningReinforcement Learning with Verifiable Rewards

  11. Adaptive Agent Design

    Sep 14, 2026Raj Kiriti Velicheti, Subhonmesh Bose, Tamer BaşarReinforcement LearningQ-Learning

  12. SCQ: Stabilizing Conservative Q-Learning with Sigmoid-Bounded Entropy

    Sep 14, 2026Xiefeng Wu, Shu Zhang, Zhaojie Chu +1Robotic RLOffline RL

  13. Robust Policy Optimization via Adversarial Importance Sampling

    Sep 14, 2026Amine Andam, Jamal Bentahar, Mustapha HedabouRobust RLPolicy Learning

  14. A Unified and Constrained View of Regularization-Based Robust Reinforcement Learning

    Sep 14, 2026Amine Andam, Jamal Bentahar, Mustapha HedabouKL-Regularized RLAdversarial Robustness

  15. T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

    Sep 12, 2026Junyao Yang, Yucheng Shi, Zhongzhi Li +4Terminal AgentsLong-Horizon Agent Evaluation

  16. Granularity-Adaptive Credit Assignment for Long-Horizon LLM Agent Reinforcement Learning

    Sep 11, 2026Taoran Liang, Yang Liu, Shang Luo +10Credit Assignment in RLStep-Level Credit Assignment in RL

  17. IMLE-VLA: Fast Single-Step Action Generation for Vision-Language-Action Policies

    Sep 11, 2026Kian Hosseinkhani (Simon Fraser University), Qinhe Peng (University of Pennsylvania), George Shramko (Simon Fraser University) +7Efficient VLA Model InferenceVision-Language-Action Models

  18. DIA: Denoising Intermediate Advantage for Diffusion Policy Optimization

    Sep 10, 2026Arjun Sohal, Yuchi Zhao, Miroslav Bogdanovic +1RL for RoboticsStep-Level Credit Assignment in RL

  19. Proxy Policy Steering

    Sep 8, 2026Chuanruo Ning, Tianrui Wang, Wei-Chiu Ma +1Robot Policy AdaptationRobot Foundation Models

  20. Mini-Batch Risk-Averse Deep Q-Learning: A Robot Navigation Case Study

    Sep 7, 2026Aayush Patel, Andrzej RuszczyńskiDeep Q-LearningRobot Navigation

  21. DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

    Sep 3, 2026Shubham Gandhi, Saurabh Goyal, Kiran Kate +1Agentic RLStep-Level Credit Assignment in RL

  22. Spurious Advantage Hidden in GRPO

    Sep 3, 2026Jiamian Wang, Samyadeep Basu, Koustava Goswami +2Reinforcement LearningGroup Relative Policy Optimization

  23. Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO

    Sep 3, 2026Hyun Bin Park, Du-Seong ChangRL for Language Model ReasoningGroup Relative Policy Optimization

  24. Multi-step Proximal Policy Improvement in Offline Reinforcement Learning

    Sep 3, 2026Soohyun Choi, Seonvin Cho, Songnam HongOffline RLPolicy Learning

  25. Tail-Likelihood Reinforcement Learning

    Sep 2, 2026Shrinivas Ramasubramanian, Daman Arora, Fahim Tajwar +11Risk-Sensitive RLRL for Generative Models