RL from Human Feedback

RL: Reinforcement Learning

Momentum

5 papers in the last four weeks, level with the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 84

All topics
CardsList
  1. A Scoping Review and Experimental Study on Reinforcement Learning from Human Feedback for Human-Robot Collaboration

    Oct 7, 2026Alexandra Coroiu, Andrea Vogt, Viktor Werbilo +3RL from Human FeedbackHuman-Robot Collaboration

  2. Constraint Tree Exploration for Learning from Language Feedback

    Oct 6, 2026Shaoang Li, Daniel R. Jiang, Jian LiRL ExplorationRL from Human Feedback

  3. EnGRICH: Enhancing Generative Reward Modeling with Critiques from Humans

    Oct 4, 2026Xuancheng Li, Beining Wang, Haitao Li +7Reward ModelingProcess Reward Models

  4. Robust Risk-Sensitive Reinforcement Learning from Corrupted Human Feedback

    Sep 30, 2026Xinyi Ni, Lifeng LaiRisk-Sensitive RLRobust RL

  5. ReF-HIL: Shaping the Critic around Human Action Neighborhoods for Efficient Human-in-the-Loop Reinforcement Learning

    Sep 29, 2026Shaoyin Luo, Song Wang, Shibo Xia +5RL for RoboticsReward Shaping

  6. Diffusion Reward Models

    Sep 27, 2026Xiangyang Wang, Bingxiang He, Zeyuan Liu +13Reward ModelingMultimodal Reward Modeling

  7. Subspace Inference Enables Efficient Active Reward Learning from Preferences

    Sep 3, 2026Yutai Zhou, Erdem BıyıkBayesian RLPreference Learning

  8. User Feedback Provides a Unique Signal that LLMs Can not Detect

    Sep 2, 2026Shachar Don-Yehiya, Leshem Choshen, Omri AbendLLM EvaluationRL from Human Feedback

  9. From Answers to Policies: Efficient In-Context Learning System through Emulating Expert Investigation

    Aug 17, 2026Minh-Ha Nguyen, Ngoc-Ngo Quang Tran, Thuy Dung Nguyen +1In-Context LearningIn-Context RL

  10. Learning from Online User Feedback for Shopping Agents

    Aug 12, 2026Haobo Zhang, Kelong Mao, Sulong Xu +2Large Language Model-Based RecommendationUser Preference Modeling

  11. Procedural Fairness Failures in RLHF from Preference Averaging

    Aug 10, 2026M P V S Gopinadh, Karthik Kamuju, Kummari Avinash +2Reward ModelingAlgorithmic Fairness

  12. LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

    Jul 31, 2026Manith Adikari, Bei Peng, Samuele Vinanzi +1Multi-Objective Reinforcement LearningReinforcement Learning

  13. An offline approach to fNIRS-guided reinforcement learning for robot behavior

    Jul 15, 2026Julia Santaniello, Madelaine Brower, Benson Jiang +3Reinforcement LearningRobot Learning

  14. RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences

    Jul 15, 2026Logan Mondal Bhamidipaty, Mykel Kochenderfer, Subramanian RamamoorthyWorld Model LearningOffline RL

  15. Multi-Modal, Multi-Environment Machine Teaching for Robust Reward Learning

    Jul 9, 2026Ali Larian, Qian Lin, Chang Zong Wu +1Reinforcement LearningHuman-in-the-Loop AI

  16. Attention Limited Reward Learning

    Jul 6, 2026Wenqian XingPairwise Preference LearningReward Modeling

  17. Human-Centric Reflective Architecture for Human-AI Collaborative Decision-Making

    Jul 3, 2026Andreas Kouridakis, Dimitrios Patiniotis Spyropoulos, George VourosHuman Preference ModelingHuman-in-the-Loop AI

  18. PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

    Jun 29, 2026Doo Hwan Hwang, Kee-Eung KimReinforcement LearningRL for Language Model Reasoning

  19. Qwen-Image-2.0-RL Technical Report

    Jun 25, 2026Yixian Xu, Kaiyuan Gao, Yuxiang Chen +25Reward ModelingRL for Diffusion Models

  20. Retroactive Advantage Correction: Closed-Form V-Trace Bias Correction for Delay-Aware RLHF

    Jun 25, 2026Arnav RajAsynchronous RLReinforcement Learning

  21. PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration

    Jun 25, 2026Arnav RajReward ModelingPost-Hoc Calibration

  22. Sculpting NeRF Geometry: Human-Preference Fine-Tuning of a 3D-Aware Face GAN

    Jun 25, 2026Archer Moore, Mingming Gong, Liam Hodgkinson3D Shape GenerationRL for Generative Models

  23. Themis: An explainable AI-enabled framework for Reinforcement Learning with Human Feedback

    Jun 23, 2026Andreas Chouliaras, Luke Connolly, Dimitris ChatzpoulosReward ModelingHuman-in-the-Loop AI

  24. AI Alignment From Social Choice Perspectives

    Jun 19, 2026Daniel Halpern, Evi Micha, Ariel D. Procaccia +3LLM AlignmentAI Alignment

  25. Uncertainty-Aware Reward Modeling for Stable RLHF

    Jun 18, 2026Licheng Pan, Haocheng Yang, Haoxuan Li +7Reward ModelingReward Hacking

  26. Generating Natural and Expressive Robot Gestures through Iterative Reinforcement Learning with Human Feedback using LLMs

    Jun 17, 2026Chris Lee, Flora Salim, Benjamin Tag +1Language Model-Based ControlHuman Motion Generation

  27. ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning

    Jun 15, 2026Wei Xiao, Weiliang Tang, Yuying Ge +4RL for RoboticsRobotic Manipulation

  28. Hidden Consensus:Preference-Validity Compression in Human Feedback

    Jun 9, 2026Dorcas Chia Ern Chua, Karen Myn Hui Lee, Jia Yue Tan +9Human Preference ModelingPreference Alignment

  29. Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output

    Jun 9, 2026Guozheng Li, Xiyan Fu, Yiwen GuoRL for Language ModelsSample-Efficient RL

  30. A Regret Minimization Framework on Preference Learning in Large Language Models

    Jun 8, 2026Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim +4Regret Minimization in RLLLM Alignment

  31. A Unifying Lens on Reward Uncertainty in RLHF

    Jun 8, 2026Ely Hahami, Yoel Zimmermann, Ray Zhou +1Reward ModelingKL-Regularized RL

  32. Multilingual Sentiment Aware Text Summarization A Reinforcement Learning Approach for Consistency Maintenance

    Jun 8, 2026Mikhail Krasitskii, Alexander Gelbukh, Olga Kolesnikova +1LLM AlignmentText Summarization

  33. EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms

    Jun 2, 2026Guilin Zhang, Chuanyi Sun, Kai Zhao +3Early StoppingReinforcement Learning

  34. When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

    Jun 2, 2026Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan +1Reward HackingLLM Evaluation

  35. Efficient Exploration for Iterative Nash Preference Optimization

    May 31, 2026Tianlong Nan, Xiaopeng Li, Christian Kroer +1Nash EquilibriumLLM Alignment

  36. The Representation-Rationalizability Tradeoff in Reward Learning

    May 29, 2026Jing Dong, Yaoliang Yu, Pascal PourpartPairwise Preference LearningReward Modeling

  37. In-Context Reward Adaptation for Robust Preference Modeling

    May 28, 2026Zhenyu Sun, Zheng Xu, Ermin WeiHuman Preference ModelingIn-Context Learning

  38. Learning Kernel-Based MDPs from Episodic Preferential Feedback

    May 22, 2026Nikola Pavlovic, Sattar Vakili, Qing ZhaoPairwise Preference LearningRegret Minimization in RL

  39. Implicit Safety Alignment from Crowd Preferences

    May 20, 2026Qian Lin, Daniel S. BrownSafe RLPreference-Based RL

  40. Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment

    May 20, 2026Zhiqin Yang, Yonggang Zhang, Wei Xue +3LLM AlignmentDirect Preference Optimization

  41. Reinforcing Human Behavior Simulation via Verbal Feedback

    May 19, 2026Weiwei Sun, Xuhui Zhou, Jiarui Liu +13RL for Language ModelsHuman Behavior Simulation

  42. ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks

    May 17, 2026Tianxiang Xu, Xiaoyan Zhu, Xin Lai +1Reward ModelingReinforcement Learning

  43. Distributed Zeroth-Order Policy Gradient for Networked Multi-agent Reinforcement Learning from Human Feedback

    May 15, 2026Pengcheng Dai, He Wang, Dongming Wang +2Policy GradientDecentralized MARL

  44. When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy

    May 12, 2026Xiaofeng Tan, Jun Liu, Bin-Bin Gao +5Flow MatchingGenerative Modeling

  45. ff-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses

    May 7, 2026Di Wu, Chengshuai Shi, Jing Yang +1RL for Language ModelsRL from Human Feedback

  46. Mitigating Cognitive Bias in RLHF by Altering Rationality

    May 7, 2026Tiffany Horter, Andrew Markham, Niki Trigoni +1Human Preference ModelingRL from Human Feedback

  47. Optimal Transport for LLM Reward Modeling from Noisy Preference

    May 7, 2026Licheng Pan, Haochen Yang, Haoxuan Li +8Reward ModelingNoisy-Label Learning

  48. Data-dependent Exploration for Online Reinforcement Learning from Human Feedback

    May 6, 2026Zhen-Yu Zhang, Yuting Tang, Jiandong Zhang +2RL ExplorationSample-Efficient RL

  49. Explaining and Preventing Alignment Collapse in Iterative RLHF

    May 5, 2026Etienne Gauthier, Francis Bach, Michael I. JordanReward HackingPolicy Gradient

  50. Efficient Preference Poisoning Attack on Offline RLHF

    May 4, 2026Chenye Yang, Weiyu Xu, Lifeng LaiDirect Preference OptimizationData Poisoning Attacks

  51. PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs

    May 1, 2026Ravi Ranjan, Utkarsh Grover, Xiaomin Lin +1Automated Code ReviewRL from Human Feedback

  52. Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback

    Apr 30, 2026Yikai Wang, Shang Liu, Jose BlanchetRegret Minimization in RLReinforcement Learning