RL from Human Feedback

RL: Reinforcement Learning

Momentum

5 papers in the last four weeks, level with the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 84

All topics
CardsList
  1. Three Models of RLHF Annotation: Extension, Evidence, and Authority

    Apr 28, 2026Steve CoyneLLM AlignmentHuman-in-the-Loop Annotation

  2. When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient

    Apr 28, 2026Shuning Shang, Hubert Strauss, Stanley Wei +2Reward ModelingPolicy Gradient

  3. Leveraging Human Feedback for Semantically-Relevant Skill Discovery

    Apr 27, 2026Maxence Hussonnois, Thommen George Karimpanal, Santu RanaAgent Skill LearningRL from Human Feedback

  4. HP-Edit: A Human-Preference Post-Training Framework for Image Editing

    Apr 21, 2026Fan Li, Chonghuinan Wang, Lina Lei +9Diffusion Model AlignmentImage Editing Evaluation

  5. Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback

    Apr 21, 2026Qiang Liu, Adrienne Kline, Ermin WeiConstrained RLPolicy Gradient Methods

  6. ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System

    Apr 20, 2026Jiacheng Liang, Yao Ma, Tharindu Kumarage +5Reward ModelingAdversarial Attacks on LLMs

  7. Efficient Federated RLHF via Zeroth-Order Policy Optimization

    Apr 20, 2026Deyi Wang, Qining Zhang, Lei YingFederated RLCommunication-Efficient Distributed Training

  8. Demystifying the unreasonable effectiveness of online alignment methods

    Apr 19, 2026Enoch Hyunwook KangLLM AlignmentDirect Preference Optimization

  9. Rater State Bias in RLHF Preference Data: An Audit Framework

    Apr 14, 2026Elena Kopteva, Vitaliy Hlynianyi-ZhukHuman Preference EvaluationHuman-in-the-Loop Annotation

  10. Unbiased Reward Modeling from Implicit Feedback for LLM Alignment

    Mar 24, 2026Hao Wang, Haocheng Yang, Licheng Pan +7Reward ModelingLLM Alignment

  11. Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models

    Feb 7, 2026Yankai Yang, Yancheng Long, Hongyang Wei +12Reward ModelingMultimodal Reward Modeling

  12. Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking

    Feb 2, 2026Mohammad Beigi, Ming Jin, Junshan Zhang +2Adversarial TrainingReward Hacking

  13. Adaptive Margin RLHF via Preference over Preferences

    Sep 26, 2025Yaswanth Chittepu, Prasann Singhal, Greg Durrett +1Pairwise Preference LearningReward Modeling

  14. Aligning Audio Captions with Human Preferences

    Sep 18, 2025Kartik Hegde, Rehana Mahfuz, Yinyi Guo +1Reward ModelingAudio-Language Models

  15. DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)

    Jul 10, 2025Wenxuan Zhou, Shujian Zhang, Brice Magdalou +4Direct Preference OptimizationHuman Preference Modeling

  16. A Technical Survey of Reinforcement Learning Techniques for Large Language Models

    Jul 5, 2025Saksham Sahai Srivastava, Vaneet AggarwalRL for Language ModelsLLM Alignment

  17. MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning

    May 30, 2025Jingyan Shen, Jiarui Yao, Rui Yang +5Pairwise Preference LearningReward Modeling

  18. Bias Fitting to Mitigate Length Bias of Reward Model in RLHF

    May 19, 2025Kangwen Zhao, Jianfeng Cai, Jinhua Zhu +5Reward ModelingLLM Alignment

  19. Distributionally Robust Reinforcement Learning with Human Feedback

    Mar 1, 2025Debmalya Mandal, Paulius Sasnauskas, Goran RadanovicDirect Preference OptimizationLLM Fine-Tuning

  20. Corruption Robust Offline Reinforcement Learning with Human Feedback

    Feb 9, 2024Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban +2Offline RLCorruption Robustness