Reward Modeling

Momentum

24 papers in the last four weeks, up 118% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 197

All topics
CardsList
  1. Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

    Jan 31, 2026Zicheng Kong, Dehua Ma, Zhenbo Xu +9Reward ModelingRL for Language Models

  2. P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist

    Jan 6, 2026Kwangwook Seo, Dongha LeeReward ModelingUser Preference Modeling

  3. HAL: Inducing Human-likeness in LLMs with Alignment

    Jan 6, 2026Masum Hasan, Junjie Zhao, Ehsan HoqueReward ModelingLLM Alignment

  4. RubricRL: Simple Generalizable Rewards for Text-to-Image Generation

    Nov 25, 2025Xuelu Feng, Yunsheng Li, Ziyu Wan +4Reward ModelingT2I Generation

  5. OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

    Oct 28, 2025Ziyou Hu, Zhengliang Shi, Minghang Zhu +5Reward ModelingRL for Language Models

  6. TripScore: Aligning LLMs for Real-World Travel Planning via Expert-Calibrated Reward

    Oct 10, 2025Yincen Qu, Huan Xiao, Feng Li +5Reward ModelingLLM Planning

  7. Rethinking Reward Models for Multi-Domain Test-Time Scaling

    Oct 1, 2025Dong Bok Lee, Seanie Lee, Sangwoo Park +12Reward ModelingLLM Evaluation

  8. Adaptive Margin RLHF via Preference over Preferences

    Sep 26, 2025Yaswanth Chittepu, Prasann Singhal, Greg Durrett +1Pairwise Preference LearningReward Modeling

  9. Aligning Audio Captions with Human Preferences

    Sep 18, 2025Kartik Hegde, Rehana Mahfuz, Yinyi Guo +1Reward ModelingAudio-Language Models

  10. MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning

    May 30, 2025Jingyan Shen, Jiarui Yao, Rui Yang +5Pairwise Preference LearningReward Modeling

  11. R3: Robust Rubric-Agnostic Reward Models

    May 19, 2025David Anugraha, Zilu Tang, Lester James V. Miranda +5Reward ModelingLLM Evaluation

  12. Bias Fitting to Mitigate Length Bias of Reward Model in RLHF

    May 19, 2025Kangwen Zhao, Jianfeng Cai, Jinhua Zhu +5Reward ModelingLLM Alignment

  13. Supervised Reward Inference

    Feb 25, 2025Will Schwarzer, Jordan Schneider, Philip S. Thomas +1Reward ModelingReinforcement Learning

  14. AgentRM: Enhancing Agent Generalization with Reward Modeling

    Feb 25, 2025Yu Xia, Jingru Fan, Weize Chen +7Reward ModelingLLM Agents

  15. TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards

    Date pendingMingxuan Cui, Jingpu Yang, Fengxian Ji +7Diffusion Model AlignmentReward Modeling

  16. Beyond Solver Verdicts: Generative Reward Models for Autoformalization

    Date pendingVikash Singh, Debargha Ganguly, Aman Goel +5Reward ModelingFormal Verification