Critic

Momentum

17 papers in the last four weeks, up 240% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 58

All topics
CardsList
  1. Role-Adaptive Policy Optimization for Offline Reinforcement Learning

    Sep 30, 2026Seonvin Cho, Soohyun Choi, Songnam HongFrictive Policy OptimizationOffline Reinforcement Learning

  2. Revisiting On-policy Adversarial Black-Box Distillation: Calibrating Groupwise Reward Geometry for Effective Advantage Construction

    Sep 30, 2026Xiao Cui, Mo Zhu, Yulei Qin +3Dataset DistillationOn-Policy

  3. Trust the Critic More

    Sep 30, 2026Kaiyue Wen, Luke Bailey, Arvind Mahankali +1Critic-Free Reinforcement LearningLarge Language Model Reinforcement Learning

  4. Privy to the Foil: Recasting Value Estimation with a Self-Privileged Critic for RLVR

    Sep 29, 2026Kun Liang, Chenming Tang, Clive Bai +5Reinforcement Learning With Verifiable RewardSoft Actor-Critic

  5. ReF-HIL: Shaping the Critic around Human Action Neighborhoods for Efficient Human-in-the-Loop Reinforcement Learning

    Sep 29, 2026Shaoyin Luo, Song Wang, Shibo Xia +5Reinforcement Learning From Human FeedbackHuman-In-The-Loop

  6. Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +3Critic-Free Reinforcement LearningReward-Only Policy Optimization Variants

  7. PDMD: Projected Distribution Matching Distillation for Video Diffusion Models

    Sep 28, 2026Zimo Wang, Junkun Yuan, Angtian Wang +9Video Diffusion ModelsDistribution Matching Distillation

  8. SpeechCritic: Learning a Diagnostic Speech Judge from Limited Human Preferences

    Sep 28, 2026Mingyue Huo, Shivam Mehta, Bhavin Jawade +2Large Audio Language ModelsCritic

  9. Opera: A Verbal Critic Framework for Long-horizon Coding Agents

    Sep 27, 2026Kai Mei, Zhiyuan Hu, Yutong Dai +7CriticLong-Horizon Agents

  10. On Preference Coverage Collapse from Hindsight Relabeling in Multi-Objective Reinforcement Learning

    Sep 22, 2026Baptiste Bonin, Caro Strickland, Audrey DurandMulti-Objective Reinforcement LearningHindsight

  11. ExecCritic: Learn to Test, Test to Improve for Coding Agents

    Sep 8, 2026Leitian Tao, Baolin Peng, Haorui Wang +7Coding AgentsTest Generation

  12. Better Call CineCrew: Consistent Ultra-Long Narrative-to-Film Generation

    Sep 7, 2026Jiaben Chen, Sixun Dong, Qinhong Zhou +4Cinematic IdealFilms

  13. LOCI: A Locator-Critic with Refinement Loop

    Aug 31, 2026Walid Bousselham, Mathilde Caron, Arsha Nagrani +1Recent Vision-Language ModelsVisual Evidence

  14. Co-Evolving Actor-Conditioned Critics for Non-Verifiable Generation

    Aug 31, 2026Jinyoung Kim, Muhammad Khalifa, Lajanugen Logeswaran +4CritiqueCritic

  15. CODS: Iterative Bellman-Residual Data Selection for Reusable Offline Reinforcement Learning

    Aug 7, 2026Ibne Farabi Shihab, Sanjeda Akter, Abu Sa-Adat Mohamed Moon-Im Al Ahsan +2Model-Based Reinforcement LearningOffline Reinforcement Learning

  16. Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning

    Aug 5, 2026Zheyuan Zhang, Manqing Mao, Hong Wang +8Group-Based Reinforcement LearningRollout

  17. Start Classifying: Categorical Critics for LLM Reinforcement Learning

    Aug 3, 2026Zhijian Zhou, Long Li, Xuan Zhang +7Large Language Model Reinforcement LearningCritic-Free Reinforcement Learning

  18. WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

    Jul 31, 2026Senyu Fei, Xiaopeng Yu, Siyin Wang +3Diffusion-Based Vision-Language-ActionsEfficient World-Action Model

  19. Offline-Online Curriculum RL for Multimodal Reasoning

    Jul 26, 2026Wendi Deng, Hang Du, Guoshun Nan +11Multimodal ReasoningCurriculum Reinforcement Learning

  20. TriAgent: Divergence-Aware Multi-Agent Committees for Cost-Efficient Financial Sentiment Analysis

    Jul 22, 2026Isabel Xu, Cynthia Xu, Rachel Ren +2Financial Sentiment AnalysisReasoning Skills

  21. HCPG-Flow:Hierarchical Contact-Progress Guidance for Flow-Policy Robot Manipulation

    Jul 20, 2026Guanghu Xie, Mingxu Li, Shuo Zhang +5Multimodal Action DistributionsRobotic Manipulation

  22. Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents

    Jul 14, 2026Yaopei Zeng, Congchao Wang, JianHang Chen +3Large Language Model AgentsConfidence Estimation

  23. Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

    Jul 13, 2026Xin Zhang, Haochen Wang, Yikang Zhou +3Multimodal Large Language ModelsLocalization

  24. When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors

    Jun 30, 2026Yuqing Yang, Qi Zhu, Zhen Han +5LLM Reasoning StrategiesCritic

  25. The Inattentional Gap: Task-Conditioned Language and Vision Models Omit the Safety-Critical Signals They Can Otherwise Report

    Jun 25, 2026Kwan Soo Shin, In Seok Kang, Yunkyung Min +2Artificial Intelligence SafetyVision Foundation Models

  26. Learning with a Single Rollout via Monte Carlo Pass@k Critic

    Jun 24, 2026Fengdi Che, Yang Liu, Lei Yu +4Large Language Model Reinforcement LearningCredit Assignment

  27. Steer, Don't Solve: Training Small Critic Models for Large Code Agents

    Jun 20, 2026Shubham Gandhi, Yiqing Xie, Atharva Naik +2Coding AgentsCritic

  28. InterleaveThinker: Reinforcing Agentic Interleaved Generation

    Jun 11, 2026Dian Zheng, Harry Lee, Manyuan Zhang +4Multi-Reference Image GenerationImage Generation

  29. A History-Aware Visually Grounded Critic for Computer Use Agents

    Jun 9, 2026Jaewoo Lee, Zaid Khan, Archiki Prasad +7Computer-Use AgentsCritic

  30. Noisy memory encoding explains negative polarity illusions

    Jun 3, 2026Yuhan Zhang, Edward GibsonNegationSurprisal

  31. When Helping Hurts and How to Fix It: Multi-Agent Debate for Data Cleaning

    Jun 1, 2026Chirag Parmar, Akshat Mehta, Henglin Wu +2Multi-Agent DebateDebate

  32. Critic-R: Improving Agentic Search using Instruction-tuned Retrievers with Natural Language Introspective Feedback

    May 30, 2026Md Zarif Ul Alam, Alireza Salemi, Hamed ZamaniAgentic SearchRetrievers

  33. Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight

    May 29, 2026Can Jin, Jiakang Li, Rui Wu +2Efficient On-Policy DistillationScalable Oversight

  34. CRITIC-R1: Learning Structured Critics for Retrieval-Augmented Generation

    May 28, 2026Wenhan Xiao, Ziwei Zhang, Chuanyue Yu +4Agentic Retrieval-Augmented Generation SystemsSearch-Augmented Reasoning

  35. Explicit Critic Guidance for Aligning Diffusion Models

    May 26, 2026Zhengyang Liang, Qihang Zhang, Ceyuan YangDiffusion AlignmentDiffusion-Based Reinforcement Learning Methods

  36. RL with Learnable Textual Feedback: A Bilevel Approach

    May 23, 2026Utsav Singh, Sidhaarth Sredharan, Souradip Chakraborty +1LLM Reasoning StrategiesFeedback

  37. Don't Forget the Critic: Value-Based Data Rehearsal for Multi-Cyclic Continual Reinforcement Learning

    May 21, 2026Benjamin Poole, Andrew Quinn, Li Yang +1Offline Reinforcement LearningCatastrophic Forgetting

  38. FedCritic: Serverless Federated Critic Learning-based Resource Allocation for Multi-Cell OFDMA in 6G

    May 20, 2026Amin Farajzadeh, Melike Erol-KantarciOrthogonal Frequency-Division MultiplexingOpen Radio Access Networks

  39. When Critics Disagree: Adaptive Reward Poisoning Attacks in RIS-Aided Wireless Control System

    May 19, 2026Deemah H. Tashman, Soumaya CherkaouiWireless CommunicationsLearning-Based Control

  40. Inline Critic Steers Image Editing

    May 12, 2026Weitai Kang, Xiaohang Zhan, Yizhou Wang +4Image EditingMulti-Reference Image Generation

  41. TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing

    May 12, 2026Yuanpeng Li, Gefei Lin, Annie Qu +1Multi-Turn Reinforcement LearningProximal Policy Optimization

  42. ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning

    May 11, 2026Wanghan Xu, Yuhao Zhou, Hengyuan Zhao +8CriticLarge Language Model Reinforcement Learning

  43. EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training

    Apr 21, 2026Chengjun Pan, Shichun Liu, Jiahang Lin +10Frictive Policy OptimizationCritic

  44. Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning

    Apr 21, 2026Yuan Zhuang, Yuexin Bian, Sihong He +7Critic LearningOff-Policy Learning