Reward Modeling

Momentum

24 papers in the last four weeks, up 118% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 197

All topics
CardsList
  1. Claim-Level Rubric Rewards for Video Caption Reinforcement Learning

    Jul 6, 2026Mingqi Gao, Hongyuan Dong, Yifei Chen +6Reward ModelingVideo Captioning

  2. Attention Limited Reward Learning

    Jul 6, 2026Wenqian XingPairwise Preference LearningReward Modeling

  3. Rank-Then-Act: Reward-Free Control from Frame-Order Progress

    Jul 2, 2026Yuriy Maksyuta, George Bredis, Ruslan Rakhimov +1RL ControlReward Modeling

  4. Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling

    Jul 2, 2026Dazhi Fu, Jiuding Yang, Yiwen Guo +1Reward ModelingLLM-as-a-Judge

  5. Test-Time Verification for Text-to-SQL via Outcome Reward Models

    Jun 29, 2026Mattia Tritto, Giuseppe Farano, Dario Di Palma +4Reward ModelingLLM Answer Verification

  6. Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation

    Jun 29, 2026Shihao Zhang, Yunzhi Li, Yuguang Yan +4Reward ModelingDiffusion Model Guidance

  7. To Reason or to Fabricate: Reasoning Without Shortcuts via Hint-Anchored Pairwise Aggregation

    Jun 28, 2026Jiuheng Lin, Chen Zhang, Yansong FengCoT FaithfulnessReward Modeling

  8. HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech

    Jun 26, 2026Sihang Nie, Xiaofen Xing, Rui Xing +5Reward ModelingSpeech Prosody

  9. Qwen-Image-2.0-RL Technical Report

    Jun 25, 2026Yixian Xu, Kaiyuan Gao, Yuxiang Chen +25Reward ModelingRL for Diffusion Models

  10. PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration

    Jun 25, 2026Arnav RajReward ModelingPost-Hoc Calibration

  11. SpatialFlow-GRPO: Where Spatial Credit Drives Image Editing

    Jun 25, 2026Yankai Yang, Yancheng Long, Wei Chen +7Reward ModelingGroup Relative Policy Optimization

  12. The Verification Horizon: No Silver Bullet for Coding Agent Rewards

    Jun 24, 2026Binghai Wang, Chenlong Zhang, Dayiheng Liu +10Reward ModelingReward Hacking

  13. MAPL: Multi-Objective Preference Learning for Robot Locomotion

    Jun 24, 2026Xiyue Chen, Muhan Lin, Shuyang Shi +1Multi-Objective Reinforcement LearningReward Modeling

  14. Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback

    Jun 23, 2026Andreas Chouliaras, Luke Connolly, Dimitris ChatzpoulosReward ModelingHuman-in-the-Loop AI

  15. Discretizing Reward Models

    Jun 19, 2026Vijay Viswanathan, Shiqi Wang, Devamanyu Hazarika +4Reward ModelingReinforcement Learning

  16. PrivacyAlign: Contextual Privacy Alignment for LLM Agents

    Jun 19, 2026Manveer Singh Tamber, Abhay Puri, Marc-Etienne Brunet +3Reward ModelingPrivacy Leakage in Language Models

  17. Your Mouse and Eyes Secretly Leak Your Preference: LLM Alignment using Implicit Feedback from Users

    Jun 18, 2026Haw-Shiuan Chang, Jeffrey Gomez, Mehul Patwari +2Reward ModelingLLM Alignment

  18. Reward as An Agent for Embodied World Models

    Jun 18, 2026Pu Li, Zhigang Lin, Qiang Wu +3Reward ModelingReward Hacking

  19. Uncertainty-Aware Reward Modeling for Stable RLHF

    Jun 18, 2026Licheng Pan, Haocheng Yang, Haoxuan Li +7Reward ModelingReward Hacking

  20. Learning User Simulators with Turing Rewards

    Jun 17, 2026Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu +5Reward ModelingRL for Language Models

  21. Steerable Cultural Preference Optimization of Reward Models

    Jun 17, 2026Minsik Oh, Advit Deepak, Sophie Wu +2Reward ModelingCultural Bias in Language Models

  22. TuneJury: An Open Metric for Improving Music Generation Preference Alignment

    Jun 15, 2026Yonghyun Kim, Junwon Lee, Haiwen Xia +5Text-to-Music GenerationMusic Generation Evaluation

  23. Graph Structured Combinatorial Semi-Bandit with Nonlinear Reward Associations through Separable Signals

    Jun 12, 2026Christoph Bauschmann, Setareh MaghsudiReward ModelingMulti-Armed Bandits

  24. Reward Modeling for Multi-Agent Orchestration

    Jun 11, 2026King Yeung Tsang, Zihao Zhao, Vishal Venkataramani +5Reward ModelingMulti-Agent Orchestration

  25. Understanding helpfulness and harmless tension in reward models

    Jun 11, 2026Eshaan Tanwar, Pepa AtanasovaReward ModelingLLM Alignment

  26. Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding

    Jun 10, 2026Hyomin Kim, Junghye Kim, Joanie Hayoun Chung +4Reward ModelingText-to-Video Generation

  27. SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation

    Jun 9, 2026Qianzhong Chen, Hau Zheng, Justin Yu +8RL for RoboticsReward Modeling

  28. Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

    Jun 8, 2026Han Zhou, Adam X. Yang, Laurence Aitchison +2Pairwise Preference LearningReward Modeling

  29. Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

    Jun 8, 2026Xin Jin, Huanqia Cai, Zhen Li +9Reward ModelingReasoning Distillation

  30. A Unifying Lens on Reward Uncertainty in RLHF

    Jun 8, 2026Ely Hahami, Yoel Zimmermann, Ray Zhou +1Reward ModelingKL-Regularized RL

  31. DynaCF: Mitigating Shortcut Learning in Reward Models via Dynamic Counterfactual Sensitivity

    Jun 8, 2026Fengyuan Liu, Yongliang Miao, Zirui He +3Pairwise Preference LearningReward Modeling

  32. Support Vector Rubrics: Closing the Gap Between Self-Generated and Human Rubrics

    Jun 6, 2026Mengyuan Sun, Yu Li, Zhuohao Yu +2Reward ModelingRubric-Based Evaluation

  33. PAFO: Pareto Fairness Optimization for Personalized Reward Modeling

    Jun 6, 2026Xiaoyan Zhao, Haoting Ni, Yang Zhang +3Reward ModelingLLM Alignment

  34. Beyond Rubrics: Exploration-Guided Evaluation Skills for Reward Modeling

    Jun 5, 2026Xing Yue, Linjuan Wu, Daoxin Zhang +2Reward ModelingLLM Evaluation

  35. Sparse Mixture-of-Experts Reward Models Learn Interpretable and Specialized Experts for Personalized Preference Modeling

    Jun 2, 2026Yifan Wang, Jinyi Mu, Mayank Jobanputra +5Pairwise Preference LearningReward Modeling

  36. Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill

    Jun 2, 2026Tao Chen, Gangwei Jiang, Pengyu Cheng +10Reward ModelingReward Model Evaluation

  37. Mitigating False Credit Propagation: Probabilistic Graphical Reward Aggregation for Rubric-Based Reinforcement Learning

    Jun 2, 2026Can Lv, Mingju Chen, Heng Chang +1Reward ModelingRL for Language Models

  38. ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents

    Jun 2, 2026Zheng Liu, Longxiang Zhang, Xintong Wang +8Reward ModelingProcess Reward Models

  39. Follow-Your-Preference++: Rethinking Preference Alignment for Image Inpainting

    Jun 2, 2026Junkun Yuan, Yutao Shen, Toru Aonishi +2Pairwise Preference LearningReward Modeling

  40. HARVE: Hacking-Aware Reward-Head Vector Editing for Robust Reward Models

    Jun 2, 2026Shuang Liu, Yuxuan Bo, Qiuyang Zhao +4Reward ModelingReward Hacking

  41. Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

    Jun 1, 2026Seojeong Park, Jiho Choi, Junyong Kang +3Reward ModelingLLM-as-a-Judge

  42. Position: Good Embodied Reward Models Need Bad Behavior Data

    May 31, 2026Ran Tian, Yilin Wu, Andrea BajcsyReward ModelingPreference Alignment

  43. From Empathy to Personalized Empathy: Adapting Empathetic Strategies to Individual Users

    May 30, 2026Wuqiang Zheng, Chengbing Wang, Yilin Yang +6Reward ModelingLLM Personalization

  44. Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs

    May 30, 2026Jiakang Li, Guanyu Zhu, Can Jin +8Reward ModelingLanguage Model Steering

  45. CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts

    May 30, 2026Rui Zhang, Xinle Wu, Yao LuReward ModelingReinforcement Learning

  46. The Representation-Rationalizability Tradeoff in Reward Learning

    May 29, 2026Jing Dong, Yaoliang Yu, Pascal PourpartPairwise Preference LearningReward Modeling

  47. The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement

    May 29, 2026Xiaobo Wang, Tong Wu, Min Tang +3Reward ModelingLLM Alignment

  48. Reward Learning from Best-of-NN Preference Data: Targets, Tradeoffs, and Design Principles

    May 28, 2026Rattana Pukdee, Maria-Florina Balcan, Pradeep RavikumarPairwise Preference LearningReward Modeling

  49. Configurable Reward Model for Balanced Safety Alignment

    May 28, 2026Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj +5Reward ModelingLanguage Model Safety Evaluation

  50. Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling

    May 28, 2026Yuchen Liu, Yingjie Feng, Lixiong Qin +5Reward ModelingAgentic RL

  51. Prompt-Level Reward Specifications for Open-Ended Post-Training

    May 28, 2026Zijun Weng, Xiaohui Hu, Shuangyong Song +3Open-Ended GenerationReward Modeling

  52. RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains

    May 27, 2026Haoxiang Jiang, Zihan Dong, Tianci Liu +5Reward ModelingRL for Language Models

  53. Refining Multidimensional Video Reward Models via Disentangled Influence Functions

    May 27, 2026Muyao Wang, Zeke Xie, Hideki NakayamaReward ModelingTraining Data Selection

  54. StoryLens: Preference-Aligned Story Rewriting via Context-Aware Narrative Enrichment

    May 27, 2026Hanwen Cui, Yuting Mei, Yuhang Fu +2Reward ModelingPersonalized Text Generation