Reward Modeling

Momentum

24 papers in the last four weeks, up 118% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 194

All topics
CardsList
  1. EnGRICH: Enhancing Generative Reward Modeling with Critiques from Humans

    Oct 4, 2026Xuancheng Li, Beining Wang, Haitao Li +7Reward ModelingProcess Reward Models

  2. MatrixReward: Reward from Rubric Matrix for Open-Ended Generation

    Sep 30, 2026Zihan Shen, Qi Liu, Zixuan Yang +4Open-Ended GenerationReward Modeling

  3. Revisiting scaling laws for reward optimization

    Sep 29, 2026Ali Aouad, Aymane El Gadarri, Vivek F. FariasReward ModelingReinforcement Learning

  4. Think Before You Score: Thinking Reward Model for Visual Generation

    Sep 29, 2026Xuehai Bai, Zhenchen Tang, Yang Shi +9Reward ModelingMultimodal Reward Modeling

  5. RankBuffer: Efficient Ranking-Based Rewards for Open-Ended Generation

    Sep 29, 2026Zixuan Yang, Yiqun Chen, Qi Liu +6Open-Ended GenerationReward Modeling

  6. CoRe: Co-Evolving Reward Models for Mitigating Latent Reward Hacking in Video Diffusion Models

    Sep 28, 2026Zhaolong Su, Yujin Han, Feng Wang +3Diffusion Model AlignmentReward Modeling

  7. Rubric Rewards from Item Response Theory

    Sep 28, 2026Milad Yazdani, Yaser Souri, Xiren Zhou +4Reward ModelingRubric-Based RL

  8. Using Context Is Not Enough: Test-Time Training for Personalized Reward Modeling

    Sep 28, 2026Bohao Wang, Xiaoyan Zhao, Yang Zhang +4Pairwise Preference LearningReward Modeling

  9. From Soft Targets to Reward Signals: How Assignment and Reward Objectives Interact

    Sep 28, 2026Jiangtao Lin, Bangyang Wei, Siyi Liu +2Pairwise Preference LearningReward Modeling

  10. CRISP: Cultural Reward Modeling for Implicit Situated Propriety

    Sep 28, 2026Zekun Yuan, Yangfan Ye, Baohang Li +6Reward ModelingRL for Language Models

  11. Evolving Support Priorities in Empathetic Reinforcement Learning

    Sep 28, 2026Pengyu Huang, Zhiyuan Han, Wenwen Tong +6Reward ModelingRL for Language Models

  12. RewardExplainer: Learning Reward Model Explanations from Counterfactual Preference Feedback

    Sep 27, 2026Jingyi He, Nier Wu, Shuang Liu +3Reward ModelingCounterfactual Explanations

  13. Diffusion Reward Models

    Sep 27, 2026Xiangyang Wang, Bingxiang He, Zeyuan Liu +13Reward ModelingMultimodal Reward Modeling

  14. A Cheap Verifier is Good Enough: LLM Post-training is Robust to Erroneous Rewards

    Sep 27, 2026Andreas Plesner, Curtis Northcutt, Francisco Guzmán +1Reward ModelingLLM Reliability

  15. FLARE: A Full-Lifecycle Dense Supervision Paradigm for Long-Horizon Coding Agents via Generative Reward Model

    Sep 20, 2026Jingxuan Xu, Gang Wu, Yanan Wu +13RL for Code GenerationReward Modeling

  16. RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling

    Sep 19, 2026Zhenchen Tang, Yang Li, Songlin Yang +6Reward ModelingMultimodal Reward Modeling

  17. MATCH: Model-Aware Tool Learning with Curriculum Scheduling and Hierarchically Gated Rewards

    Sep 17, 2026Shihao Liu, Hao Yin, Lijun Liu +3Reward ModelingCurriculum RL

  18. F2^{2}DR: A Fine-Grained Full-Pipeline Reward Framework for DeepSearch Workflows

    Sep 17, 2026Bojian Xiong, Wentao Ding, Yujing Lu +11Reward ModelingLLM Evaluation

  19. FIERCE: From Generalist Robot Policies to Fast Specialists via Progress-Failure Feedback

    Sep 16, 2026Runjia Tan, Yuang Tu, Yujie Yan +3Reward ModelingRobot Policy Learning

  20. Don't Count the Edits, Judge by the Outcome Alone: Reward-Based Evaluation for Grammatical Error Correction

    Sep 14, 2026Hayeong Ryu, Sunhee Jo, Seunguk Yu +1Reward ModelingReference-Free Evaluation

  21. AgenticGen: Reward-Guided Agentic Video Generation for Advertising

    Sep 10, 2026Xingyuan Bu, Chengru Song, Hao Zhou +9Reward ModelingAgentic RL

  22. Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward

    Sep 9, 2026Eshwar Reddy M, Sourav KarmakarReward ModelingReward Hacking

  23. ALIGN-HOLD: Experience Alignment for Real-Time Hold Control in Large-Scale Ride-Hailing Matching at DiDi

    Sep 9, 2026Zuhao Zhang, Xu Liu, Kai Wan +3RL ControlReward Modeling

  24. WorldReward: Reward Modeling for Camera-Conditioned World Models

    Sep 3, 2026Yibin Wang, Zehan Wang, Junshu Tang +13Reward ModelingCamera-Conditioned Video Generation

  25. Patterning in Practice: Debiasing Reward Models with Susceptibilities

    Sep 1, 2026George Wang, Elizabeth Donoway, Daniel MurfetReward ModelingDebiased ML

  26. Beyond Uncertainty: Multi-Solver Disagreement Rewards for Self-Evolving Reasoning Curricula

    Aug 30, 2026Vinoth Selvendran, Zhanming ZhangReward ModelingRL for Language Model Reasoning

  27. VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

    Aug 19, 2026Yinming Huang, Shuyuan Tu, Xi Yan +6Reward ModelingAudio-Video Generation

  28. MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques

    Aug 12, 2026Jiabao Zhuang, Changhao Jiang, Hanchen Wang +11Music Generation EvaluationReward Modeling

  29. Procedural Fairness Failures in RLHF from Preference Averaging

    Aug 10, 2026M P V S Gopinadh, Karthik Kamuju, Kummari Avinash +2Reward ModelingAlgorithmic Fairness

  30. RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

    Aug 10, 2026Dongchi Huang, Hongyin Zhang, Bohan Hou +11Reward ModelingRobot Foundation Models

  31. Finding the Signal in the Spam: Jointly Learning Rewards and Worker Reliability from Pairwise Comparisons

    Aug 10, 2026Kaustubh Shivshankar Shejole, Tanish Agarwal, Arpit Agarwal +1Pairwise Preference LearningReward Modeling

  32. CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning

    Aug 10, 2026Ambuj Mehrish, Sebastiano VasconReward ModelingRL for Language Models

  33. TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

    Aug 9, 2026Yidong Wang, Yan Zhan, Ziteng Feng +16Reward ModelingPairwise Preference Evaluation

  34. RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

    Aug 6, 2026Chenglong Wang, Ziming Zhu, Yifu Huo +9Reward ModelingRL for Language Models

  35. Rethinking Personalized Reward Modeling for LLMs under Preference Heterogeneity via Group-Debiased Federated Learning

    Aug 3, 2026Seongyoon Kim, Boryeong Cho, Jihwan Oh +2Pairwise Preference LearningReward Modeling

  36. Beyond Routing Weights: Faithful Response-Level Interpretation of Mixture-of-Experts Reward Models via Contribution Contrast

    Jul 31, 2026Yifan Wang, Jinyi Mu, Mayank Jobanputra +4Reward ModelingNeural Network Interpretability

  37. Learning Latent Reasoning Traces for Scalar Reward Models End-to-End

    Jul 31, 2026Sanwoo Lee, Clive Bai, Hsiu-Yuan Huang +3Reward ModelingLLM Alignment

  38. OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

    Jul 30, 2026Qiushi Sun, Kanzhi Cheng, Yian Wang +20VLM EvaluationComputer-Use Agent Benchmarks

  39. DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification

    Jul 27, 2026Sagnik Sinha, Shreyas ShresthaNumerical Reasoning in Language ModelsReward Modeling

  40. What do Reward Models Memorize?

    Jul 27, 2026Ivo Verhoeven, Pushkar Mishra, Ekaterina ShutovaReward ModelingPairwise Preference Evaluation

  41. SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

    Jul 25, 2026Yang Wan, Zhenhao Zhang, Jierui Wang +1Reward ModelingLLM-as-a-Judge

  42. CSPF: A Constrained Shared-Private Fusion Method for Non-Verifiable Preference Evaluation

    Jul 23, 2026Hehao Zhang, Danli Wang, Xinyuan Wang +1Pairwise Preference LearningReward Modeling

  43. Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

    Jul 22, 2026Jianshu Zhang, Keliang Wu, Haoran Lu +8Reward ModelingProcess Reward Models

  44. Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making

    Jul 19, 2026Amez Amanj Ali, Kuo-Kun TsengReward ModelingLLM Self-Correction

  45. A Method for Learning Value Systems in Generative AI

    Jul 18, 2026Andrés Holgado-Sánchez, Holger Billhardt, Sascha OssowskiReward ModelingLLM Alignment

  46. Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

    Jul 17, 2026Bo-An Chang, Yu-Chih ChenVLM EvaluationReward Modeling

  47. Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning

    Jul 15, 2026Dingsu Wang, Filip Ryzner, Kelly He +12Reward ModelingLearning to Rank

  48. DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation

    Jul 14, 2026Yu Fang, Wanxi Dong, Jiaqi Liu +7RL for RoboticsReward Modeling

  49. Reward Valuation in Large Language Models: Causal Induction of Anhedonia

    Jul 7, 2026Melika Honarmand, Samin Mahdipour Aghabagher, Martin SchrimpfReward ModelingCognitive Modeling

  50. Claim-Level Rubric Rewards for Video Caption Reinforcement Learning

    Jul 6, 2026Mingqi Gao, Hongyuan Dong, Yifei Chen +6Reward ModelingVideo Captioning

  51. Attention Limited Reward Learning

    Jul 6, 2026Wenqian XingPairwise Preference LearningReward Modeling