Critic-Free Reinforcement Learning

Latest papers 34

All topics
CardsList
  1. Trust the Critic More

    Sep 30, 2026Kaiyue Wen, Luke Bailey, Arvind Mahankali +1Critic-Free Reinforcement LearningLarge Language Model Reinforcement Learning

  2. Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +3Critic-Free Reinforcement LearningReward-Only Policy Optimization Variants

  3. T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

    Sep 12, 2026Junyao Yang, Yucheng Shi, Zhongzhi Li +4Critic-Free Reinforcement LearningLong-Horizon Task Planning

  4. CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

    Aug 31, 2026Amir Saeidi, Zehua Zhang, Rishitosh Singh +6Large Language Model AgentsCritic-Free Reinforcement Learning

  5. Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents

    Aug 21, 2026Yanze Jiang, Mingxuan Li, Yuhao Wang +2Large Language Model AgentsRuntime

  6. Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition

    Aug 10, 2026Changhao Li, Yifang Zhang, Heng Zhang +6Robotic Manipulation PoliciesRobotic Manipulation

  7. DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

    Aug 7, 2026Xucong Wang, Zhe Zhao, Liheng Yu +3Reinforcement Learning With Verifiable RewardCritic-Free Reinforcement Learning

  8. Start Classifying: Categorical Critics for LLM Reinforcement Learning

    Aug 3, 2026Zhijian Zhou, Long Li, Xuan Zhang +7Large Language Model Reinforcement LearningCritic-Free Reinforcement Learning

  9. Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

    Jul 30, 2026Qiangqiang He, Zhongheng Wu, ZiJian WangCredit AssignmentReinforcement Learning With Verifiable Reward

  10. Learning to Detect UI Principle Violations via Reinforcement Learning

    Jul 22, 2026Nishi Mehta, Swathi Alse, Himani Kumawat +2Code QualityInteraction Design

  11. PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

    Jun 29, 2026Doo Hwan Hwang, Kee-Eung KimReinforcement Learning From Human FeedbackCritic-Free Reinforcement Learning

  12. BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards

    Jun 27, 2026Yupeng Chang, Yuan Wu, Yi ChangReinforcement Learning With Verifiable RewardCritic-Free Reinforcement Learning

  13. Phi-Actor-Critic: Steering General-Sum Games to Pareto-Efficient Correlated Equilibria

    Jun 9, 2026Wongyu Lee, Francesco Lelli, Omran Ayoub +1Multi-Agent Reinforcement LearningSoft Actor-Critic

  14. On the Generalization Gap in Self-Evolving Language Model Reasoning

    May 31, 2026Zhenting Qi, Susanna Maria Baby, Stefanie Anna Baby +5Self-EvolutionReasoning Benchmark

  15. Drift Q-Learning

    May 29, 2026Anas Houssaini, Mohamad H. Danesh, Amin Abyaneh +3Diffusion-Based Reinforcement Learning MethodsFlow Policies

  16. Explicit Critic Guidance for Aligning Diffusion Models

    May 26, 2026Zhengyang Liang, Qihang Zhang, Ceyuan YangDiffusion AlignmentDiffusion-Based Reinforcement Learning Methods

  17. Value-Gradient Hypothesis of RL for LLMs

    May 20, 2026Arip Asadulaev, Daniil Ognev, Karim Salta +1Large Language Model Reinforcement LearningCritic-Free Reinforcement Learning

  18. FedCritic: Serverless Federated Critic Learning-based Resource Allocation for Multi-Cell OFDMA in 6G

    May 20, 2026Amin Farajzadeh, Melike Erol-KantarciOrthogonal Frequency-Division MultiplexingOpen Radio Access Networks

  19. The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits

    May 9, 2026Tianhao Cheng, Zeyu Huang, Zihan Qiu +5Critic-Free Reinforcement LearningCredit Assignment

  20. When Does Critique Improve AI-Assisted Theoretical Physics? SCALAR: Structured Critic--Actor Loop for Agentic Reasoning

    May 7, 2026Vasilis Niarchos, Constantinos Papageorgakis, Alexander G. Stapleton +1Artificial Intelligence ScientistsCritique

  21. Cross-Modal Navigation with Multi-Agent Reinforcement Learning

    May 7, 2026Shuo Liu, Xinzichen Li, Christopher AmatoMultimodal AgentsMulti-Agent Reinforcement Learning

  22. Soft Deterministic Policy Gradient with Gaussian Smoothing

    May 7, 2026Hyunjun Na, Donghwan LeePolicy GradientValue Functions

  23. VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model

    May 2, 2026Wenhao Li, Xiu Su, Yichao Cao +5Diffusion-Based Vision-Language-ActionsCritic-Free Reinforcement Learning

  24. Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation

    May 1, 2026Xin-Ye Li, Ren-Biao Liu, Yun-Ji Zhang +3Pass-Rate EvaluationCode Generation

  25. Scalable Neighborhood-Based Multi-Agent Actor-Critic

    Apr 20, 2026Tim Goppelsroeder, Rasmus JensenMulti-Agent Reinforcement LearningCritic-Free Reinforcement Learning

  26. Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation

    Nov 18, 2025Weimin Bai, Yubo Li, Weijian Luo +43D Generative Models3D Spatial Reasoning

  27. Transformer-Based Multi-Agent Reinforcement Learning for Networked Systems with Long-Range Interactions

    Nov 17, 2025Vidur Sinha, Muhammed Ustaomeroglu, Guannan QuMulti-Agent Reinforcement LearningCritic-Free Reinforcement Learning

  28. Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning

    Date pendingZikang Shan, Han Zhong, Liwei Wang +1Large Language Model Reinforcement LearningCritic-Free Reinforcement Learning