24 papers in the last four weeks, up 118% on the four weeks before. 0.2% of all new papers.
Jul 6, 2026·Mingqi Gao, Hongyuan Dong, Yifei Chen +6Reward ModelingVideo Captioning
1Tsinghua Shenzhen International Graduate School, Tsinghua University · 3LLM Department, Tencent · University of Chinese Academy of Sciences
Jul 6, 2026·Wenqian XingPairwise Preference LearningReward Modeling
Management Science and Engineering Department, Stanford University
Jul 4, 2026·Jiaxiang Cheng, Bing Ma, Xuhua Ren +4Diffusion Model AlignmentReward Modeling
Tencent Hunyuan, China
Jul 2, 2026·Yuriy Maksyuta, George Bredis, Ruslan Rakhimov +1RL ControlReward Modeling
T-Tech
Jul 2, 2026·Dazhi Fu, Jiuding Yang, Yiwen Guo +1Reward ModelingLLM-as-a-Judge
School of Data Science, The Chinese University of Hong Kong, Shenzhen, China · LIGHTSPEED · Independent Researcher
Jun 30, 2026·Yuanhao Ban, Tong Xie, Sohyun An +6Reward ModelingCompositional T2I Generation
1Arena Intelligence Inc · 2UCLA
Jun 29, 2026·Mattia Tritto, Giuseppe Farano, Dario Di Palma +4Reward ModelingLLM Answer Verification
Polytechnic University of Bari, Bari, Italy · IBM T.J. Watson Research Center, Yorktown Heights, NY, USA
Jun 29, 2026·Subramanyam Sahoo, Aman Chadha, Vinija Jain +1Reward ModelingReward Hacking
1Horizon Research · 2Apple · 3Meta +1
Jun 29, 2026·Shihao Zhang, Yunzhi Li, Yuguang Yan +4Reward ModelingDiffusion Model Guidance
Huawei Central Research Institute · Guangdong University of Technology
Jun 28, 2026·Jiuheng Lin, Chen Zhang, Yansong FengCoT FaithfulnessReward Modeling
Wangxuan Institute of Computer Technology, Peking University
Jun 26, 2026·Sihang Nie, Xiaofen Xing, Rui Xing +5Reward ModelingSpeech Prosody
South China University of Technology, China · Huya Inc., China · Tongyi Fun Team, Alibaba Group, China +1
Jun 25, 2026·Yixian Xu, Kaiyuan Gao, Yuxiang Chen +25Reward ModelingRL for Diffusion Models
Equal contribution. · Corresponding author.
Jun 25, 2026·Arnav RajReward ModelingPost-Hoc Calibration
Department of Computer Science and Engineering, Indian Institute of Technology Delhi, New Delhi, India.
Jun 25, 2026·Yankai Yang, Yancheng Long, Wei Chen +7Reward ModelingGroup Relative Policy Optimization
Harbin Institute of Technology, Shenzhen · Kuaishou Technology
Jun 24, 2026·Binghai Wang, Chenlong Zhang, Dayiheng Liu +10Reward ModelingReward Hacking
Qwen Team
Jun 24, 2026·Xiyue Chen, Muhan Lin, Shuyang Shi +1Multi-Objective Reinforcement LearningReward Modeling
Department of Electrical and Computer Engineering, Purdue University, West Lafayette, IN 47906, USA · Department of Computer Science, Purdue University, West Lafayette, IN 47906, USA · independent researcher
Jun 23, 2026·Andreas Chouliaras, Luke Connolly, Dimitris ChatzpoulosReward ModelingHuman-in-the-Loop AI
School of Computer Science, University College Dublin, Belfield, Dublin 4, Ireland
Jun 19, 2026·Vijay Viswanathan, Shiqi Wang, Devamanyu Hazarika +4Reward ModelingReinforcement Learning
1Carnegie Mellon University · 2Meta Superintelligence Labs
Jun 19, 2026·Manveer Singh Tamber, Abhay Puri, Marc-Etienne Brunet +3Reward ModelingPrivacy Leakage in Language Models
University of Waterloo · †Work done during internship at ServiceNow AI Research · 2ServiceNow AI Research +2
Jun 18, 2026·Haw-Shiuan Chang, Jeffrey Gomez, Mehul Patwari +2Reward ModelingLLM Alignment
University of Massachusetts, Amherst, USA · York University, Canada
Jun 18, 2026·Pu Li, Zhigang Lin, Qiang Wu +3Reward ModelingReward Hacking
Kairos Team
Jun 18, 2026·Licheng Pan, Haocheng Yang, Haoxuan Li +7Reward ModelingReward Hacking
Zhejiang University · Xiaohongshu Inc · National University of Singapore +1
Jun 17, 2026·Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu +5Reward ModelingRL for Language Models
Massachusetts Institute of Technology · Stanford University · MIT-IBM Watson AI Lab
Jun 17, 2026·Zirong LiReward ModelingReinforcement Learning
Tiangong University
Jun 17, 2026·Minsik Oh, Advit Deepak, Sophie Wu +2Reward ModelingCultural Bias in Language Models
1Stanford University · University of Amsterdam
Jun 15, 2026·Yonghyun Kim, Junwon Lee, Haiwen Xia +5Text-to-Music GenerationMusic Generation Evaluation
Georgia Tech · KAIST · Peking University +3
Jun 12, 2026·Christoph Bauschmann, Setareh MaghsudiReward ModelingMulti-Armed Bandits
Department of Electrical Engineering and Information Technology Ruhr University Bochum Bochum, Germany
Jun 11, 2026·King Yeung Tsang, Zihao Zhao, Vishal Venkataramani +5Reward ModelingMulti-Agent Orchestration
Rutgers University · Salesforce AI Research
Jun 11, 2026·Eshaan Tanwar, Pepa AtanasovaReward ModelingLLM Alignment
University of Copenhagen
Jun 10, 2026·Hyomin Kim, Junghye Kim, Joanie Hayoun Chung +4Reward ModelingText-to-Video Generation
Department of Artificial Intelligence, Korea University · Department of Statistics, Korea University