RL from Human Feedback

RL: Reinforcement Learning

Momentum

5 papers in the last four weeks, level with the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 84

All topics
CardsList
  1. Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output

    Jun 9, 2026Guozheng Li, Xiyan Fu, Yiwen GuoRL for Language ModelsSample-Efficient RL

  2. A Regret Minimization Framework on Preference Learning in Large Language Models

    Jun 8, 2026Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim +4Regret Minimization in RLLLM Alignment

  3. A Unifying Lens on Reward Uncertainty in RLHF

    Jun 8, 2026Ely Hahami, Yoel Zimmermann, Ray Zhou +1Reward ModelingKL-Regularized RL

  4. Multilingual Sentiment Aware Text Summarization A Reinforcement Learning Approach for Consistency Maintenance

    Jun 8, 2026Mikhail Krasitskii, Alexander Gelbukh, Olga Kolesnikova +1LLM AlignmentText Summarization

  5. EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms

    Jun 2, 2026Guilin Zhang, Chuanyi Sun, Kai Zhao +3Early StoppingReinforcement Learning

  6. When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

    Jun 2, 2026Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan +1Reward HackingLLM Evaluation

  7. Efficient Exploration for Iterative Nash Preference Optimization

    May 31, 2026Tianlong Nan, Xiaopeng Li, Christian Kroer +1Nash EquilibriumLLM Alignment

  8. The Representation-Rationalizability Tradeoff in Reward Learning

    May 29, 2026Jing Dong, Yaoliang Yu, Pascal PourpartPairwise Preference LearningReward Modeling

  9. In-Context Reward Adaptation for Robust Preference Modeling

    May 28, 2026Zhenyu Sun, Zheng Xu, Ermin WeiHuman Preference ModelingIn-Context Learning

  10. Learning Kernel-Based MDPs from Episodic Preferential Feedback

    May 22, 2026Nikola Pavlovic, Sattar Vakili, Qing ZhaoPairwise Preference LearningRegret Minimization in RL

  11. Implicit Safety Alignment from Crowd Preferences

    May 20, 2026Qian Lin, Daniel S. BrownSafe RLPreference-Based RL

  12. Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment

    May 20, 2026Zhiqin Yang, Yonggang Zhang, Wei Xue +3LLM AlignmentDirect Preference Optimization

  13. Reinforcing Human Behavior Simulation via Verbal Feedback

    May 19, 2026Weiwei Sun, Xuhui Zhou, Jiarui Liu +13RL for Language ModelsHuman Behavior Simulation

  14. ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks

    May 17, 2026Tianxiang Xu, Xiaoyan Zhu, Xin Lai +1Reward ModelingReinforcement Learning

  15. Distributed Zeroth-Order Policy Gradient for Networked Multi-agent Reinforcement Learning from Human Feedback

    May 15, 2026Pengcheng Dai, He Wang, Dongming Wang +2Policy GradientDecentralized MARL

  16. When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy

    May 12, 2026Xiaofeng Tan, Jun Liu, Bin-Bin Gao +5Flow MatchingGenerative Modeling

  17. ff-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses

    May 7, 2026Di Wu, Chengshuai Shi, Jing Yang +1RL for Language ModelsRL from Human Feedback

  18. Mitigating Cognitive Bias in RLHF by Altering Rationality

    May 7, 2026Tiffany Horter, Andrew Markham, Niki Trigoni +1Human Preference ModelingRL from Human Feedback

  19. Optimal Transport for LLM Reward Modeling from Noisy Preference

    May 7, 2026Licheng Pan, Haochen Yang, Haoxuan Li +8Reward ModelingNoisy-Label Learning

  20. Data-dependent Exploration for Online Reinforcement Learning from Human Feedback

    May 6, 2026Zhen-Yu Zhang, Yuting Tang, Jiandong Zhang +2RL ExplorationSample-Efficient RL

  21. Explaining and Preventing Alignment Collapse in Iterative RLHF

    May 5, 2026Etienne Gauthier, Francis Bach, Michael I. JordanReward HackingPolicy Gradient

  22. Efficient Preference Poisoning Attack on Offline RLHF

    May 4, 2026Chenye Yang, Weiyu Xu, Lifeng LaiDirect Preference OptimizationData Poisoning Attacks

  23. PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs

    May 1, 2026Ravi Ranjan, Utkarsh Grover, Xiaomin Lin +1Automated Code ReviewRL from Human Feedback

  24. Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback

    Apr 30, 2026Yikai Wang, Shang Liu, Jose BlanchetRegret Minimization in RLReinforcement Learning