Preference-Based RL

RL: Reinforcement Learning

Momentum

10 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 77

All topics
CardsList
  1. MAPL: Multi-Objective Preference Learning for Robot Locomotion

    Jun 24, 2026Xiyue Chen, Muhan Lin, Shuyang Shi +1Multi-Objective Reinforcement LearningReward Modeling

  2. Self-Evolution for Multi-Turn Tool-Calling Agents via Divergence-Point Preference Learning

    Jun 22, 2026Jiaqiang TangTool-Using AgentsSelf-Improving Agents

  3. UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning

    Jun 17, 2026Mohamed Nabail, Leo Kaixuan Cheng, Jingmin Wang +1Pairwise Preference EvaluationRL Exploration

  4. Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning

    Jun 15, 2026Tung M. Luu, Hwanhee Kim, Younghwan Lee +1Offline RLSemi-Supervised Learning

  5. PAWS: Preference Learning with Advantage-Weighted Segments

    Jun 10, 2026Aleksandar Taranovic, Onur Celik, Niklas Freymuth +6Credit Assignment in RLRobotic RL

  6. A Regret Minimization Framework on Preference Learning in Large Language Models

    Jun 8, 2026Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim +4Regret Minimization in RLLLM Alignment

  7. FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization

    Jun 3, 2026Yihao Wu, He Zhang, Junbo Tan +2Offline RLVision-Language-Action Models

  8. Preference-Calibrated Human-in-the-Loop Reinforcement Learning for Robotic Manipulation

    Jun 2, 2026Zeyi Liu, Guangyao Liu, Yinuo Qu +6Credit Assignment in RLRobotic RL

  9. Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition

    Jun 1, 2026Pengyang Ling, Jiazi Bu, Yujie Zhou +6Diffusion Model AlignmentGroup Relative Policy Optimization

  10. S-SPPO: Semantic-Calibrated Self-Play Preference Optimization

    Jun 1, 2026Xiwen Chen, Wenhui Zhu, Jingjing Wang +13LLM AlignmentSelf-Play RL

  11. Efficient Exploration for Iterative Nash Preference Optimization

    May 31, 2026Tianlong Nan, Xiaopeng Li, Christian Kroer +1Nash EquilibriumLLM Alignment

  12. From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning

    May 31, 2026Jun-Jie Yang, Chia-Heng Hsu, Kui-Yuan Chen +1Pairwise Preference LearningRepresentation Learning

  13. Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems

    May 29, 2026Jonathan Colaço Carr, Prakash Panangaden, Doina Precup +1Pairwise Preference LearningMarkov Decision Processes

  14. Learning Kernel-Based MDPs from Episodic Preferential Feedback

    May 22, 2026Nikola Pavlovic, Sattar Vakili, Qing ZhaoPairwise Preference LearningRegret Minimization in RL

  15. From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning

    May 22, 2026Ranxu zhang, zeyang li, Jiacheng Huang +5Agentic RLReinforcement Learning

  16. Token-weighted Direct Preference Optimization with Attention

    May 21, 2026Chengyu Huang, Zhuohang Li, Sheng-Yen Chou +1Pairwise Preference LearningLLM Alignment

  17. Implicit Safety Alignment from Crowd Preferences

    May 20, 2026Qian Lin, Daniel S. BrownSafe RLPreference-Based RL

  18. How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR

    May 20, 2026Richa Verma, Balaraman RavindranDirect Preference OptimizationRL for Language Model Reasoning

  19. PREFINE: Preference-Based Implicit Reward and Cost Fine-Tuning for Safety Alignment

    May 20, 2026Richa Verma, Bavish Kulur, Sanjay Chawla +1Direct Preference OptimizationConstrained RL

  20. General Preference Reinforcement Learning

    May 18, 2026Muhammad Umer, Muhammad Ahmed Mohsin, Ahsan Bilal +5Multi-Objective Language Model AlignmentRL Fine-Tuning

  21. Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation

    May 18, 2026Guining Cao, Jiaxin Peng, Chu Zeng +3Pairwise Preference LearningOpen-Ended Generation

  22. ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks

    May 17, 2026Tianxiang Xu, Xiaoyan Zhu, Xin Lai +1Reward ModelingReinforcement Learning

  23. Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment

    May 17, 2026Yucong Huang, Xiucheng Li, Kaiqi Zhao +1Reward ModelingLLM Alignment

  24. OHP-RL: Online Human Preference as Guidance in Reinforcement Learning for Robot Manipulation

    May 15, 2026Yunyang Mo, Jian Li, Qiwei Wu +2Robotic RLHuman-in-the-Loop AI

  25. Embedding-perturbed Exploration Preference Optimization for Flow Models

    May 15, 2026Sujie Hu, Chubin Chen, Jiashu Zhu +3AI AlignmentGroup Relative Policy Optimization

  26. Distributed Zeroth-Order Policy Gradient for Networked Multi-agent Reinforcement Learning from Human Feedback

    May 15, 2026Pengcheng Dai, He Wang, Dongming Wang +2Policy GradientDecentralized MARL

  27. Driving Intents Amplify Planning-Oriented Reinforcement Learning

    May 12, 2026Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang +4RL for Autonomous DrivingGoal-Conditioned RL