Reward Modeling

Momentum

24 papers in the last four weeks, up 118% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 197

All topics
CardsList
  1. Claim-Level Rubric Rewards for Video Caption Reinforcement Learning

    Jul 6, 2026Mingqi Gao, Hongyuan Dong, Yifei Chen +6Reward ModelingVideo Captioning

  2. Attention Limited Reward Learning

    Jul 6, 2026Wenqian XingPairwise Preference LearningReward Modeling

  3. Rank-Then-Act: Reward-Free Control from Frame-Order Progress

    Jul 2, 2026Yuriy Maksyuta, George Bredis, Ruslan Rakhimov +1RL ControlReward Modeling

  4. Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling

    Jul 2, 2026Dazhi Fu, Jiuding Yang, Yiwen Guo +1Reward ModelingLLM-as-a-Judge

  5. Test-Time Verification for Text-to-SQL via Outcome Reward Models

    Jun 29, 2026Mattia Tritto, Giuseppe Farano, Dario Di Palma +4Reward ModelingLLM Answer Verification

  6. Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation

    Jun 29, 2026Shihao Zhang, Yunzhi Li, Yuguang Yan +4Reward ModelingDiffusion Model Guidance

  7. To Reason or to Fabricate: Reasoning Without Shortcuts via Hint-Anchored Pairwise Aggregation

    Jun 28, 2026Jiuheng Lin, Chen Zhang, Yansong FengCoT FaithfulnessReward Modeling

  8. HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech

    Jun 26, 2026Sihang Nie, Xiaofen Xing, Rui Xing +5Reward ModelingSpeech Prosody

  9. Qwen-Image-2.0-RL Technical Report

    Jun 25, 2026Yixian Xu, Kaiyuan Gao, Yuxiang Chen +25Reward ModelingRL for Diffusion Models

  10. PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration

    Jun 25, 2026Arnav RajReward ModelingPost-Hoc Calibration

  11. SpatialFlow-GRPO: Where Spatial Credit Drives Image Editing

    Jun 25, 2026Yankai Yang, Yancheng Long, Wei Chen +7Reward ModelingGroup Relative Policy Optimization

  12. The Verification Horizon: No Silver Bullet for Coding Agent Rewards

    Jun 24, 2026Binghai Wang, Chenlong Zhang, Dayiheng Liu +10Reward ModelingReward Hacking

  13. MAPL: Multi-Objective Preference Learning for Robot Locomotion

    Jun 24, 2026Xiyue Chen, Muhan Lin, Shuyang Shi +1Multi-Objective Reinforcement LearningReward Modeling

  14. Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback

    Jun 23, 2026Andreas Chouliaras, Luke Connolly, Dimitris ChatzpoulosReward ModelingHuman-in-the-Loop AI

  15. Discretizing Reward Models

    Jun 19, 2026Vijay Viswanathan, Shiqi Wang, Devamanyu Hazarika +4Reward ModelingReinforcement Learning

  16. PrivacyAlign: Contextual Privacy Alignment for LLM Agents

    Jun 19, 2026Manveer Singh Tamber, Abhay Puri, Marc-Etienne Brunet +3Reward ModelingPrivacy Leakage in Language Models

  17. Your Mouse and Eyes Secretly Leak Your Preference: LLM Alignment using Implicit Feedback from Users

    Jun 18, 2026Haw-Shiuan Chang, Jeffrey Gomez, Mehul Patwari +2Reward ModelingLLM Alignment

  18. Reward as An Agent for Embodied World Models

    Jun 18, 2026Pu Li, Zhigang Lin, Qiang Wu +3Reward ModelingReward Hacking

  19. Uncertainty-Aware Reward Modeling for Stable RLHF

    Jun 18, 2026Licheng Pan, Haocheng Yang, Haoxuan Li +7Reward ModelingReward Hacking

  20. Learning User Simulators with Turing Rewards

    Jun 17, 2026Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu +5Reward ModelingRL for Language Models

  21. Steerable Cultural Preference Optimization of Reward Models

    Jun 17, 2026Minsik Oh, Advit Deepak, Sophie Wu +2Reward ModelingCultural Bias in Language Models

  22. TuneJury: An Open Metric for Improving Music Generation Preference Alignment

    Jun 15, 2026Yonghyun Kim, Junwon Lee, Haiwen Xia +5Text-to-Music GenerationMusic Generation Evaluation

  23. Graph Structured Combinatorial Semi-Bandit with Nonlinear Reward Associations through Separable Signals

    Jun 12, 2026Christoph Bauschmann, Setareh MaghsudiReward ModelingMulti-Armed Bandits

  24. Reward Modeling for Multi-Agent Orchestration

    Jun 11, 2026King Yeung Tsang, Zihao Zhao, Vishal Venkataramani +5Reward ModelingMulti-Agent Orchestration

  25. Understanding helpfulness and harmless tension in reward models

    Jun 11, 2026Eshaan Tanwar, Pepa AtanasovaReward ModelingLLM Alignment

  26. Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding

    Jun 10, 2026Hyomin Kim, Junghye Kim, Joanie Hayoun Chung +4Reward ModelingText-to-Video Generation