Reward Modeling

Momentum

24 papers in the last four weeks, up 118% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 197

All topics
CardsList
  1. WorldReward: Reward Modeling for Camera-Conditioned World Models

    Sep 3, 2026Yibin Wang, Zehan Wang, Junshu Tang +13Reward ModelingCamera-Conditioned Video Generation

  2. Patterning in Practice: Debiasing Reward Models with Susceptibilities

    Sep 1, 2026George Wang, Elizabeth Donoway, Daniel MurfetReward ModelingDebiased ML

  3. Beyond Uncertainty: Multi-Solver Disagreement Rewards for Self-Evolving Reasoning Curricula

    Aug 30, 2026Vinoth Selvendran, Zhanming ZhangReward ModelingRL for Language Model Reasoning

  4. VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

    Aug 19, 2026Yinming Huang, Shuyuan Tu, Xi Yan +6Reward ModelingAudio-Video Generation

  5. MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques

    Aug 12, 2026Jiabao Zhuang, Changhao Jiang, Hanchen Wang +11Music Generation EvaluationReward Modeling

  6. Procedural Fairness Failures in RLHF from Preference Averaging

    Aug 10, 2026M P V S Gopinadh, Karthik Kamuju, Kummari Avinash +2Reward ModelingAlgorithmic Fairness

  7. RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

    Aug 10, 2026Dongchi Huang, Hongyin Zhang, Bohan Hou +11Reward ModelingRobot Foundation Models

  8. Finding the Signal in the Spam: Jointly Learning Rewards and Worker Reliability from Pairwise Comparisons

    Aug 10, 2026Kaustubh Shivshankar Shejole, Tanish Agarwal, Arpit Agarwal +1Pairwise Preference LearningReward Modeling

  9. CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning

    Aug 10, 2026Ambuj Mehrish, Sebastiano VasconReward ModelingRL for Language Models

  10. TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

    Aug 9, 2026Yidong Wang, Yan Zhan, Ziteng Feng +16Reward ModelingPairwise Preference Evaluation

  11. RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

    Aug 6, 2026Chenglong Wang, Ziming Zhu, Yifu Huo +9Reward ModelingRL for Language Models

  12. Rethinking Personalized Reward Modeling for LLMs under Preference Heterogeneity via Group-Debiased Federated Learning

    Aug 3, 2026Seongyoon Kim, Boryeong Cho, Jihwan Oh +2Pairwise Preference LearningReward Modeling

  13. Beyond Routing Weights: Faithful Response-Level Interpretation of Mixture-of-Experts Reward Models via Contribution Contrast

    Jul 31, 2026Yifan Wang, Jinyi Mu, Mayank Jobanputra +4Reward ModelingNeural Network Interpretability

  14. Learning Latent Reasoning Traces for Scalar Reward Models End-to-End

    Jul 31, 2026Sanwoo Lee, Clive Bai, Hsiu-Yuan Huang +3Reward ModelingLLM Alignment

  15. OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

    Jul 30, 2026Qiushi Sun, Kanzhi Cheng, Yian Wang +20VLM EvaluationComputer-Use Agent Benchmarks

  16. DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification

    Jul 27, 2026Sagnik Sinha, Shreyas ShresthaNumerical Reasoning in Language ModelsReward Modeling

  17. What do Reward Models Memorize?

    Jul 27, 2026Ivo Verhoeven, Pushkar Mishra, Ekaterina ShutovaReward ModelingPairwise Preference Evaluation

  18. SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

    Jul 25, 2026Yang Wan, Zhenhao Zhang, Jierui Wang +1Reward ModelingLLM-as-a-Judge

  19. CSPF: A Constrained Shared-Private Fusion Method for Non-Verifiable Preference Evaluation

    Jul 23, 2026Hehao Zhang, Danli Wang, Xinyuan Wang +1Pairwise Preference LearningReward Modeling

  20. Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

    Jul 22, 2026Jianshu Zhang, Keliang Wu, Haoran Lu +8Reward ModelingProcess Reward Models

  21. Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making

    Jul 19, 2026Amez Amanj Ali, Kuo-Kun TsengReward ModelingLLM Self-Correction

  22. A Method for Learning Value Systems in Generative AI

    Jul 18, 2026Andrés Holgado-Sánchez, Holger Billhardt, Sascha OssowskiReward ModelingLLM Alignment

  23. Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

    Jul 17, 2026Bo-An Chang, Yu-Chih ChenVLM EvaluationReward Modeling

  24. Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning

    Jul 15, 2026Dingsu Wang, Filip Ryzner, Kelly He +12Reward ModelingLearning to Rank

  25. DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation

    Jul 14, 2026Yu Fang, Wanxi Dong, Jiaqi Liu +7RL for RoboticsReward Modeling

  26. Reward Valuation in Large Language Models: Causal Induction of Anhedonia

    Jul 7, 2026Melika Honarmand, Samin Mahdipour Aghabagher, Martin SchrimpfReward ModelingCognitive Modeling