Trust Region Policy Optimization

Momentum

0 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 16

All topics
CardsList
  1. Group Adaptive Clipping Policy Optimization

    Aug 31, 2026Sheng Jia, Xiao Wang, Shiva Prasad Kasiviswanathan +1Group Relative Policy OptimizationPolicy Optimization

  2. Deconstructing Off-Policy Ratios: Entropy-Normalized Trust Regions for Asynchronous Reinforcement Learning

    Jul 24, 2026Guanqun Zhao, Zijun Xie, Binbin Zheng +5Asynchronous RLRL for Language Model Reasoning

  3. Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning

    Jul 21, 2026Junyao Yang, Yucheng Shi, Zongxia Li +6Asynchronous RLProximal Policy Optimization

  4. Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning

    Jun 24, 2026Bang Giang Le, Viet Cuong TaSequential MARLTrust Region Policy Optimization

  5. TRIDENT: Breaking the Hybrid-Safety-Physics Coupling for Provably Safe Multi-Agent Reinforcement Learning

    Jun 16, 2026Zijie Meng, Ziwei Li, Yufei Liu +5Cyber-Physical SystemsReinforcement Learning

  6. αα-fair heterogeneous agent reinforcement learning

    Jun 11, 2026Yao-hua Franck Xu, Tayeb Lemlouma, Jean-Marie Bonnin +1Algorithmic FairnessPolicy Optimization

  7. Rethinking the Divergence Regularization in LLM RL

    Jun 8, 2026Jiarui Yao, Xiangxin Zhou, Penghui Qi +3RL for Language ModelsPolicy Optimization

  8. Local Guidance, Global Impact: Gaussian-Reshaped Trust Region Unlocks Behavior Transitions

    Jun 2, 2026Bingxu Liu, Jiashun Liu, Johan Obando-Ceron +5Non-Stationary RLReinforcement Learning

  9. Trust Region Q Adjoint Matching

    May 26, 2026Yonghoon Dong, Kyungmin Lee, Changyeon Kim +2Reinforcement LearningKL-Regularized RL

  10. Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates

    May 10, 2026Anish Diwan, Davide Tateo, Christopher E. Mower +3Reinforcement LearningPolicy Optimization

  11. Rethinking Ratio-Based Trust Regions for Policy Optimization in Multi-Agent Reinforcement Learning

    May 9, 2026Chulabhaya Wijesundara, Andrea Baisero, Zhongheng Li +3Multi-Agent System OptimizationPolicy Optimization

  12. ANO: Robust Policy Optimization via Bounded, Redescending Gain Fields

    May 4, 2026Yiheng Zhang, Yiming Wang, Kaiyan Zhao +3Policy Gradient MethodsProximal Policy Optimization

  13. Bounded Ratio Reinforcement Learning

    Apr 20, 2026Yunke Ao, Le Chen, Bruce D. Lee +5Reinforcement LearningGroup Relative Policy Optimization

  14. QUATRO: Query-Adaptive Trust Region Policy Optimization for LLM Fine-tuning

    Feb 4, 2026Doyeon Lee, Eunyi Lyou, Hyunsoo Cho +3RL for Language Model ReasoningPolicy Optimization

  15. SB-TRPO: Towards Safe Reinforcement Learning with Hard Constraints

    Dec 29, 2025Dominik Wagner, Ankit Kanwar, Luke OngSafety-Critical ControlPolicy Optimization

  16. Trust Region Masking for Long-Horizon LLM Reinforcement Learning

    Dec 28, 2025Yingru Li, Jiacai Liu, Jiawei Xu +4RL for Language ModelsReinforcement Learning