Reward Modeling

Momentum

24 papers in the last four weeks, up 118% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 194

All topics
CardsList
  1. Judging in Latent Space: Efficient Generative Reward Modeling via Semantics-Preserving Compression

    Oct 7, 2026Mingqing Yuan, Xiaobo Liang, Junwei Yang +5Reward ModelingLLM-as-a-Judge

  2. Visual Jev Rewards: Reference-Bound Verification for Multi-Subject Image Generation

    Oct 7, 2026Baoteng Li, Wenzhuo Wu, Kongming Liang +1Reward ModelingImage Generation Evaluation

  3. Personalize at Test Time: Learning User Preferences for Image Generation

    Oct 6, 2026Jiamu Bai, Jiaming Hu, Yanhong Wu +1User Preference ModelingDiffusion Model Alignment

  4. EnGRICH: Enhancing Generative Reward Modeling with Critiques from Humans

    Oct 4, 2026Xuancheng Li, Beining Wang, Haitao Li +7Reward ModelingProcess Reward Models

  5. MatrixReward: Reward from Rubric Matrix for Open-Ended Generation

    Sep 30, 2026Zihan Shen, Qi Liu, Zixuan Yang +4Open-Ended GenerationReward Modeling

  6. Revisiting scaling laws for reward optimization

    Sep 29, 2026Ali Aouad, Aymane El Gadarri, Vivek F. FariasReward ModelingReinforcement Learning

  7. Think Before You Score: Thinking Reward Model for Visual Generation

    Sep 29, 2026Xuehai Bai, Zhenchen Tang, Yang Shi +9Reward ModelingMultimodal Reward Modeling

  8. RankBuffer: Efficient Ranking-Based Rewards for Open-Ended Generation

    Sep 29, 2026Zixuan Yang, Yiqun Chen, Qi Liu +6Open-Ended GenerationReward Modeling

  9. CoRe: Co-Evolving Reward Models for Mitigating Latent Reward Hacking in Video Diffusion Models

    Sep 28, 2026Zhaolong Su, Yujin Han, Feng Wang +3Diffusion Model AlignmentReward Modeling

  10. Rubric Rewards from Item Response Theory

    Sep 28, 2026Milad Yazdani, Yaser Souri, Xiren Zhou +4Reward ModelingRubric-Based RL

  11. Using Context Is Not Enough: Test-Time Training for Personalized Reward Modeling

    Sep 28, 2026Bohao Wang, Xiaoyan Zhao, Yang Zhang +4Pairwise Preference LearningReward Modeling

  12. From Soft Targets to Reward Signals: How Assignment and Reward Objectives Interact

    Sep 28, 2026Jiangtao Lin, Bangyang Wei, Siyi Liu +2Pairwise Preference LearningReward Modeling

  13. CRISP: Cultural Reward Modeling for Implicit Situated Propriety

    Sep 28, 2026Zekun Yuan, Yangfan Ye, Baohang Li +6Reward ModelingRL for Language Models

  14. Evolving Support Priorities in Empathetic Reinforcement Learning

    Sep 28, 2026Pengyu Huang, Zhiyuan Han, Wenwen Tong +6Reward ModelingRL for Language Models

  15. RewardExplainer: Learning Reward Model Explanations from Counterfactual Preference Feedback

    Sep 27, 2026Jingyi He, Nier Wu, Shuang Liu +3Reward ModelingCounterfactual Explanations

  16. Diffusion Reward Models

    Sep 27, 2026Xiangyang Wang, Bingxiang He, Zeyuan Liu +13Reward ModelingMultimodal Reward Modeling

  17. A Cheap Verifier is Good Enough: LLM Post-training is Robust to Erroneous Rewards

    Sep 27, 2026Andreas Plesner, Curtis Northcutt, Francisco Guzmán +1Reward ModelingLLM Reliability

  18. FLARE: A Full-Lifecycle Dense Supervision Paradigm for Long-Horizon Coding Agents via Generative Reward Model

    Sep 20, 2026Jingxuan Xu, Gang Wu, Yanan Wu +13RL for Code GenerationReward Modeling

  19. RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling

    Sep 19, 2026Zhenchen Tang, Yang Li, Songlin Yang +6Reward ModelingMultimodal Reward Modeling

  20. MATCH: Model-Aware Tool Learning with Curriculum Scheduling and Hierarchically Gated Rewards

    Sep 17, 2026Shihao Liu, Hao Yin, Lijun Liu +3Reward ModelingCurriculum RL

  21. F2^{2}DR: A Fine-Grained Full-Pipeline Reward Framework for DeepSearch Workflows

    Sep 17, 2026Bojian Xiong, Wentao Ding, Yujing Lu +11Reward ModelingLLM Evaluation

  22. FIERCE: From Generalist Robot Policies to Fast Specialists via Progress-Failure Feedback

    Sep 16, 2026Runjia Tan, Yuang Tu, Yujie Yan +3Reward ModelingRobot Policy Learning

  23. Don't Count the Edits, Judge by the Outcome Alone: Reward-Based Evaluation for Grammatical Error Correction

    Sep 14, 2026Hayeong Ryu, Sunhee Jo, Seunguk Yu +1Reward ModelingReference-Free Evaluation

  24. AgenticGen: Reward-Guided Agentic Video Generation for Advertising

    Sep 10, 2026Xingyuan Bu, Chengru Song, Hao Zhou +9Reward ModelingAgentic RL

  25. Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward

    Sep 9, 2026Eshwar Reddy M, Sourav KarmakarReward ModelingReward Hacking

  26. ALIGN-HOLD: Experience Alignment for Real-Time Hold Control in Large-Scale Ride-Hailing Matching at DiDi

    Sep 9, 2026Zuhao Zhang, Xu Liu, Kai Wan +3RL ControlReward Modeling

  27. WorldReward: Reward Modeling for Camera-Conditioned World Models

    Sep 3, 2026Yibin Wang, Zehan Wang, Junshu Tang +13Reward ModelingCamera-Conditioned Video Generation

  28. Patterning in Practice: Debiasing Reward Models with Susceptibilities

    Sep 1, 2026George Wang, Elizabeth Donoway, Daniel MurfetReward ModelingDebiased ML

  29. Beyond Uncertainty: Multi-Solver Disagreement Rewards for Self-Evolving Reasoning Curricula

    Aug 30, 2026Vinoth Selvendran, Zhanming ZhangReward ModelingRL for Language Model Reasoning

  30. VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

    Aug 19, 2026Yinming Huang, Shuyuan Tu, Xi Yan +6Reward ModelingAudio-Video Generation

  31. MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques

    Aug 12, 2026Jiabao Zhuang, Changhao Jiang, Hanchen Wang +11Music Generation EvaluationReward Modeling

  32. Procedural Fairness Failures in RLHF from Preference Averaging

    Aug 10, 2026M P V S Gopinadh, Karthik Kamuju, Kummari Avinash +2Reward ModelingAlgorithmic Fairness

  33. RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

    Aug 10, 2026Dongchi Huang, Hongyin Zhang, Bohan Hou +11Reward ModelingRobot Foundation Models

  34. Finding the Signal in the Spam: Jointly Learning Rewards and Worker Reliability from Pairwise Comparisons

    Aug 10, 2026Kaustubh Shivshankar Shejole, Tanish Agarwal, Arpit Agarwal +1Pairwise Preference LearningReward Modeling

  35. CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning

    Aug 10, 2026Ambuj Mehrish, Sebastiano VasconReward ModelingRL for Language Models

  36. TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

    Aug 9, 2026Yidong Wang, Yan Zhan, Ziteng Feng +16Reward ModelingPairwise Preference Evaluation

  37. RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

    Aug 6, 2026Chenglong Wang, Ziming Zhu, Yifu Huo +9Reward ModelingRL for Language Models

  38. Rethinking Personalized Reward Modeling for LLMs under Preference Heterogeneity via Group-Debiased Federated Learning

    Aug 3, 2026Seongyoon Kim, Boryeong Cho, Jihwan Oh +2Pairwise Preference LearningReward Modeling

  39. Beyond Routing Weights: Faithful Response-Level Interpretation of Mixture-of-Experts Reward Models via Contribution Contrast

    Jul 31, 2026Yifan Wang, Jinyi Mu, Mayank Jobanputra +4Reward ModelingNeural Network Interpretability

  40. Learning Latent Reasoning Traces for Scalar Reward Models End-to-End

    Jul 31, 2026Sanwoo Lee, Clive Bai, Hsiu-Yuan Huang +3Reward ModelingLLM Alignment

  41. OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

    Jul 30, 2026Qiushi Sun, Kanzhi Cheng, Yian Wang +20VLM EvaluationComputer-Use Agent Benchmarks

  42. DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification

    Jul 27, 2026Sagnik Sinha, Shreyas ShresthaNumerical Reasoning in Language ModelsReward Modeling

  43. What do Reward Models Memorize?

    Jul 27, 2026Ivo Verhoeven, Pushkar Mishra, Ekaterina ShutovaReward ModelingPairwise Preference Evaluation

  44. SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

    Jul 25, 2026Yang Wan, Zhenhao Zhang, Jierui Wang +1Reward ModelingLLM-as-a-Judge

  45. CSPF: A Constrained Shared-Private Fusion Method for Non-Verifiable Preference Evaluation

    Jul 23, 2026Hehao Zhang, Danli Wang, Xinyuan Wang +1Pairwise Preference LearningReward Modeling

  46. Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

    Jul 22, 2026Jianshu Zhang, Keliang Wu, Haoran Lu +8Reward ModelingProcess Reward Models

  47. Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making

    Jul 19, 2026Amez Amanj Ali, Kuo-Kun TsengReward ModelingLLM Self-Correction

  48. A Method for Learning Value Systems in Generative AI

    Jul 18, 2026Andrés Holgado-Sánchez, Holger Billhardt, Sascha OssowskiReward ModelingLLM Alignment

  49. Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

    Jul 17, 2026Bo-An Chang, Yu-Chih ChenVLM EvaluationReward Modeling

  50. Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning

    Jul 15, 2026Dingsu Wang, Filip Ryzner, Kelly He +12Reward ModelingLearning to Rank

  51. DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation

    Jul 14, 2026Yu Fang, Wanxi Dong, Jiaqi Liu +7RL for RoboticsReward Modeling

  52. Reward Valuation in Large Language Models: Causal Induction of Anhedonia

    Jul 7, 2026Melika Honarmand, Samin Mahdipour Aghabagher, Martin SchrimpfReward ModelingCognitive Modeling