Policy Learning

Momentum

79 papers in the last four weeks, up 316% on the four weeks before. 0.8% of all new papers.

Jul 13Week of Sep 28

Latest papers 416

All topics
CardsList
  1. Regularized policy gradient with learned mixtures of Gaussians for games with continuous actions

    Sep 29, 2026Ondřej Kubíček, Viliam Lisý, Tuomas SandholmGame-Playing AgentsSelf-Play RL

  2. T2^2Mem: Learning Test-Time Memory for Robotics

    Sep 29, 2026Yize Liu, Huang Huang, Yining Hong +4Robot Policy LearningTest-Time Adaptation of VLA Models

  3. Learning to Explore Hidden Kinematics for Articulated Object Manipulation

    Sep 29, 2026Ruiyao Liu, Boshu Lei, Zhuoyang Pan +1RL for RoboticsActive Perception

  4. Provable Benefits of Regularization: Fast Rates for Adversarial Imitation Learning

    Sep 28, 2026Hanbin Zhou, Shangzhe Li, Alexander Braverman +1Reinforcement LearningAdversarial Imitation Learning

  5. Agent Priors-guided Policy Learning

    Sep 28, 2026Puming Jiang, Tianrun Hu, Haozhe Du +4Robot Skill LearningRobot Imitation Learning

  6. Behavioral Foundation Models for Quality Diversity

    Sep 28, 2026Nazim Bendib, Nicolas Perrin-Gilbert, Olivier SigaudReinforcement LearningQuality-Diversity Optimization

  7. Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation

    Sep 28, 2026Xin Li, Hao Jiang, Xin Gao +6Language Model DistillationMulti-Teacher Knowledge Distillation

  8. PIVOT: Pivot-Aware On Policy Self Distillation for Multi-Turn VLM Agents

    Sep 28, 2026Jiazhou Zhou, Hu Zhou, Yucheng Chen +3On-Policy Self-DistillationReinforcement Learning with Verifiable Rewards

  9. On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

    Sep 28, 2026Julianna Piskorz, Antonin Berthon, Mihaela van der SchaarLanguage Model DistillationOn-Policy Distillation

  10. ASCT: Attentive Search over Counterfactual Trees for Credit Assignment in Agentic Reinforcement Learning

    Sep 28, 2026Yang Li, Jinhan Yang, hai liu +8Agentic RLCredit Assignment in RL

  11. GraphHCA: Closed-Form Hindsight Credit Assignment for Long-Horizon LLM Agents

    Sep 28, 2026Haodong Zhu, Yangyang Ren, Changbai Li +4Credit Assignment in RLStep-Level Credit Assignment in RL

  12. Cross-Rollout Bellman Closure for Long-Horizon Agentic Reinforcement Learning

    Sep 28, 2026Yangyang Ren, Haodong Zhu, Linlin Yang +3Agentic RLStep-Level Credit Assignment in RL

  13. When Sparse Reward Meets Dense Distillation: Training Dynamics of On-Policy Distillation

    Sep 28, 2026Xinke Jiang, Tao Feng, Zhibang Yang +4Gradient InterferenceReinforcement Learning with Verifiable Rewards

  14. UniOPSD: Unifying Outcome and Hindsight Feedback for Agentic Reinforcement Learning

    Sep 28, 2026Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai +8Agentic RLCredit Assignment in RL

  15. SIPO: Selective-Inference Policy Optimization for Tree-Structured Agentic RL

    Sep 28, 2026Zenghuang Fu, Ningqi Chen, Mingda Jia +10Agentic RLReinforcement Learning

  16. SOLAR: A State-Driven Online Learning Rate Scheduler for LLM Pretraining

    Sep 28, 2026Qiulin Shang, Binyu Wang, Yongqi Qiao +3Language Model PretrainingLearning Rate Scheduling

  17. QAMM: Adjoint MeanFlow Matching for Few-Step Offline Reinforcement Learning

    Sep 28, 2026Yuehu Gong, Shutong Ding, Mokai Pan +4Flow MatchingMeanFlow

  18. FailPatch: Failure Residual Patching for Vision-Language-Action Models

    Sep 28, 2026Peng Yu, Jiacheng Wang, Ziheng Zhang +6Robot Policy LearningRobot Policy Adaptation

  19. Learning Perturbation Robust Policies for LLM Agents with Stable Optimization

    Sep 28, 2026Pengxin Wang, Yuanzhe LI, Yuxin Ren +2RL Post-TrainingRobust RL

  20. Estimate, Don't Imitate: Reusing Differentiable State-Based Policies for Visuomotor Control

    Sep 27, 2026Denis Shcherba, Adrian Abel, Eckart Cobo-Briesewitz +3Visuomotor Policy LearningRobotic Manipulation

  21. ICMAPE: In-Context Multiagent Pure Exploration

    Sep 27, 2026Xinyi Hu, Alessio Russo, Aldo PacchianoRL ExplorationDecentralized MARL

  22. Future Information-Directed Sampling for Bayesian Nonstationary Bandits

    Sep 27, 2026Yichen Song, Alessio Russo, Aldo PacchianoMulti-Armed BanditsNon-Stationary Bandits

  23. Demonstration-Free Success-Probability Reward Learning for Generalist Robot Policies

    Sep 27, 2026Duo Wu, Haifeng Wang, Rongwei Lu +6Robotic RLSparse-Reward RL

  24. HiLoRe: What to Store, Compress, or Recompute for Efficient GRPO Training

    Sep 27, 2026Xinrui Chen, Mengyang Li, Ou Wu +1Group Relative Policy OptimizationPolicy Learning

  25. NLPG: Natural-Language Policy Gradients for Self-Evolving Language Agents

    Sep 27, 2026Xu Liu, WenZhang Wei, Jun Cao +4Continual Learning for LLM AgentsPolicy Optimization

  26. Action Shaping: Policies Absorb What They Can Express

    Sep 26, 2026Yanjun Chen, Jinghan Wang, Xiaoyu Shen +2Policy OptimizationPolicy Learning

  27. Learning from Mixed-Quality Deployment Experience for Robot Manipulation

    Sep 24, 2026Yangang Ren, Yujie Yan, Zirui Li +6Robot Policy LearningOffline RL