Step-Level Advantage Estimation

Momentum

2 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 22

All topics
CardsList
  1. Group-Marginalized Self-Rewarding RL Drives Zero-Label Self-Evolving

    Sep 29, 2026Yiming Wang, Yikang Liu, Qingyuan Tian +4Group-Based Reinforcement LearningStep-Level Advantage Estimation

  2. Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs for Agentic Reinforcement Learning

    Sep 24, 2026Xincheng Yao, Haobo Fu, Weiming Liu +1Group-Based Reinforcement LearningAgentic Reinforcement Learning

  3. EGGROLL, Unrolled: Understanding and Improving Low-Rank Evolution Strategies at Scale

    Sep 12, 2026Ege C. Kaya, Abolfazl HashemiMean Squared ErrorStep-Level Advantage Estimation

  4. A^2Agent: Action-Aware Reinforcement Learning for Repository-Level Code Localization Agents

    Aug 30, 2026Doyeon Kim, Suyoung Bae, Yumin Lee +1Coding AgentsLocalization

  5. BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards

    Jun 27, 2026Yupeng Chang, Yuan Wu, Yi ChangReinforcement Learning With Verifiable RewardCritic-Free Reinforcement Learning

  6. Learning with a Single Rollout via Monte Carlo Pass@k Critic

    Jun 24, 2026Fengdi Che, Yang Liu, Lei Yu +4Large Language Model Reinforcement LearningCredit Assignment

  7. Direct Advantage Estimation for Scalable and Sample-efficient Deep Reinforcement Learning

    Jun 18, 2026Hsiao-Ru Pan, Bernhard SchölkopfStep-Level Advantage EstimationLatent Dynamics

  8. On the Variance of Temporal Difference Learning and its Reduction Using Control Variates

    Jun 18, 2026Hsiao-Ru Pan, Bernhard SchölkopfTemporal DifferenceVariance Reduction

  9. Rethinking Groups in Critic-Free RLVR

    Jun 15, 2026Yihong Wu, Liheng Ma, Lingfeng Xiao +4Group-Based Reinforcement LearningStep-Level Advantage Estimation

  10. From Player to Master: Enhancing Test-Time Learning of LLM Agents via Reinforcement Learning over Memory

    Jun 7, 2026Yishuo Cai, Xingyu Guo, Xuancheng Huang +8Large Language Model AgentsTest-Time Training

  11. On Advantage Estimates for Max@K Policy Gradients

    Jun 4, 2026Shota Takashiro, Soichiro Nishimori, Paavo Parmas +6Policy GradientStep-Level Advantage Estimation

  12. OPD+: Rethinking the Advantage Design for On-Policy Distillation

    May 31, 2026Hanyang Zhao, Haoxian Chen, Han Lin +3Uni-OpdStep-Level Advantage Estimation

  13. VeriGate: Verifier-Gated Step-Level Supervision for GRPO

    May 28, 2026Aakriti Agrawal, Minghui Liu, Furong HuangReinforcement Learning With Verifiable RewardVerifiable Rewards

  14. Faithful Mobile GUI Agents with Guided Advantage Estimator

    May 2, 2026Haowen Hu, Pengzhou Cheng, Zheng Wu +3Graphical User Interface AgentsGraphical User Interface

  15. Stabilizing Efficient Reasoning with Step-Level Advantage Selection

    Apr 27, 2026Han Wang, Xiaodong Yu, Jialian Wu +4LLM Reasoning StrategiesStep-Level Advantage Estimation

  16. Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning

    Apr 23, 2026Yongcan Yu, Lingxiao He, Jian Liang +5Step-Level Advantage EstimationRejection Sampling

  17. Reducing Credit Assignment Variance via Counterfactual Reasoning Paths

    Apr 20, 2026Fei Ding, Yongkang Zhang, Youwei Wang +1Credit AssignmentLarge Language Model Reinforcement Learning

  18. Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation

    Feb 5, 2026Zhiqi Yu, Zhangquan Chen, Mengting Liu +2Group-Based Reinforcement LearningStep-Level Advantage Estimation