Preference-Based RL

RL: Reinforcement Learning

Momentum

10 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 77

All topics
CardsList
  1. GAW-PO: Preference Optimization with Gradient-Aligned Token Weights

    Oct 1, 2026Andreea Dutulescu, Stefan Ruseti, Mihai Masala +2LLM AlignmentDirect Preference Optimization

  2. PROMO: Preference-conditioned Multi-Objective Reinforcement Learning for Quadrupedal Robots

    Oct 1, 2026Amr Mousa, Rifny Rachman, Neil Karavis +2Multi-Objective Reinforcement LearningEnergy-Efficient Robot Locomotion

  3. PrefPI: Preference-Guided Steering into Out-of-Distribution Behaviors

    Sep 30, 2026Seungeun Rho, Wontaek Kim, Danfei Xu +1Robot Policy LearningRobot Policy Adaptation

  4. Patient-Centered Treatment Planning for Chronic Multimorbidity: A Hierarchical Reinforcement Learning Framework for Preference Modeling

    Sep 30, 2026Nafiseh Payani, Soham Das, G. Anthony Wilson +1HealthcareHierarchical RL

  5. Robust Risk-Sensitive Reinforcement Learning from Corrupted Human Feedback

    Sep 30, 2026Xinyi Ni, Lifeng LaiRisk-Sensitive RLRobust RL

  6. Revisiting scaling laws for reward optimization

    Sep 29, 2026Ali Aouad, Aymane El Gadarri, Vivek F. FariasReward ModelingReinforcement Learning

  7. On Preference Coverage Collapse from Hindsight Relabeling in Multi-Objective Reinforcement Learning

    Sep 22, 2026Baptiste Bonin, Caro Strickland, Audrey DurandMulti-Objective Reinforcement LearningExperience Replay

  8. The Operable Pareto Front: Distilling Offline Search into Run-Time Control for Multi-Objective UAV Edge-Computing Scheduling

    Sep 16, 2026Qiao Liao, Zhiyong Feng, Bin Wu +1Trajectory OptimizationEdge Computing

  9. Specifying Reward Functions for RL Without Environment Sampling

    Sep 14, 2026Stephane Hatgis-Kessell, W. Bradley Knox, Emma BrunskillLLM-Guided RLReward Design for RL

  10. ALIGN-HOLD: Experience Alignment for Real-Time Hold Control in Large-Scale Ride-Hailing Matching at DiDi

    Sep 9, 2026Zuhao Zhang, Xu Liu, Kai Wan +3RL ControlReward Modeling

  11. Subspace Inference Enables Efficient Active Reward Learning from Preferences

    Sep 3, 2026Yutai Zhou, Erdem BıyıkBayesian RLPreference Learning

  12. Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization

    Aug 10, 2026Wenxiao Zhao, Shu Wang, Ying Nian WuLLM AlignmentDirect Preference Optimization

  13. Multi-Agent Reinforcement Learning via Agent-Specific Preference

    Aug 9, 2026Ni Mu, Yao Luan, Yiqin Yang +1Decentralized MARLCooperative MARL

  14. Why Study Emergent Behavior When You Can Regulate It? Aligning Multi-Agent Systems with Reward Prediction

    Aug 7, 2026Assaf Caftory, Almog Zemach, Moshe Butman +1Multi-Agent Reinforcement LearningEmergent Behavior in Multi-Agent Systems

  15. SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling

    Aug 3, 2026Evan Assmus, Qining Zhang, Lei YingReinforcement LearningRobotic RL

  16. Crayotter: Learning Long-Horizon Video Editing Agents via Group-Relative Preference Backpropagation

    Aug 3, 2026Lecheng Yan, Jianze Lin, Yichong Zhang +5Credit Assignment in RLVideo Editing

  17. LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

    Jul 31, 2026Manith Adikari, Bei Peng, Samuele Vinanzi +1Multi-Objective Reinforcement LearningReinforcement Learning

  18. Learning Latent Reasoning Traces for Scalar Reward Models End-to-End

    Jul 31, 2026Sanwoo Lee, Clive Bai, Hsiu-Yuan Huang +3Reward ModelingLLM Alignment

  19. AutoPref: Automatic Discovery of Task-Specific Preference Objectives for Neural Combinatorial Optimization

    Jul 30, 2026Shengda Gu, Kai Li, Xinyi Ke +3Automated Algorithm DiscoveryPairwise Preference Evaluation

  20. Conservative Query and Adaptive Regularization for Offline RL Under Uncertainty Estimation

    Jul 21, 2026Li-Rong Zhou, Qin-Wen Luo, Sheng-Jun HuangReinforcement LearningOffline RL

  21. Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models

    Jul 14, 2026Ilias Kazantzidis, Timothy J. Norman, Yali Du +1Safe RLReward Design for RL

  22. Deployable Human Preference Alignment in Robotics: Learning Representative Rewards from Diverse Human Preferences

    Jul 14, 2026Taehyung Kim, Gwangmo Lee, Minjun Chang +2ClusteringPreference Alignment

  23. Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability

    Jul 13, 2026Simone Drago, Marco Mussi, Leonardo Bianconi +1Pairwise Preference LearningPairwise Comparison

  24. SPLC: Social Preference Learning for Crowd Robot Navigation

    Jul 2, 2026Zixuan Chen, Hao Fu, Haiwen Hu +1Robot NavigationSocial Robot Navigation

  25. CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning

    Jul 2, 2026Hexian Ni, Tao Lu, Yinghao CaiRobotic RLMultimodal Reward Modeling

  26. VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

    Jul 1, 2026Kuan-Chen Chen, Winston Chen, Wei-Fang Sun +1Multimodal Reward ModelingReward Design for RL

  27. Freeform Preference Learning for Robotic Manipulation

    Jun 30, 2026Marcel Torne, Anubha Mahajan, Abhijnya Bhat +1Long-Horizon Robotic ManipulationRobot Skill Learning

  28. MAPL: Multi-Objective Preference Learning for Robot Locomotion

    Jun 24, 2026Xiyue Chen, Muhan Lin, Shuyang Shi +1Multi-Objective Reinforcement LearningReward Modeling

  29. Self-Evolution for Multi-Turn Tool-Calling Agents via Divergence-Point Preference Learning

    Jun 22, 2026Jiaqiang TangTool-Using AgentsSelf-Improving Agents

  30. UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning

    Jun 17, 2026Mohamed Nabail, Leo Kaixuan Cheng, Jingmin Wang +1Pairwise Preference EvaluationRL Exploration

  31. Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning

    Jun 15, 2026Tung M. Luu, Hwanhee Kim, Younghwan Lee +1Offline RLSemi-Supervised Learning

  32. PAWS: Preference Learning with Advantage-Weighted Segments

    Jun 10, 2026Aleksandar Taranovic, Onur Celik, Niklas Freymuth +6Credit Assignment in RLRobotic RL

  33. A Regret Minimization Framework on Preference Learning in Large Language Models

    Jun 8, 2026Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim +4Regret Minimization in RLLLM Alignment

  34. FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization

    Jun 3, 2026Yihao Wu, He Zhang, Junbo Tan +2Offline RLVision-Language-Action Models

  35. Preference-Calibrated Human-in-the-Loop Reinforcement Learning for Robotic Manipulation

    Jun 2, 2026Zeyi Liu, Guangyao Liu, Yinuo Qu +6Credit Assignment in RLRobotic RL

  36. Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition

    Jun 1, 2026Pengyang Ling, Jiazi Bu, Yujie Zhou +6Diffusion Model AlignmentGroup Relative Policy Optimization

  37. S-SPPO: Semantic-Calibrated Self-Play Preference Optimization

    Jun 1, 2026Xiwen Chen, Wenhui Zhu, Jingjing Wang +13LLM AlignmentSelf-Play RL

  38. Efficient Exploration for Iterative Nash Preference Optimization

    May 31, 2026Tianlong Nan, Xiaopeng Li, Christian Kroer +1Nash EquilibriumLLM Alignment

  39. From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning

    May 31, 2026Jun-Jie Yang, Chia-Heng Hsu, Kui-Yuan Chen +1Pairwise Preference LearningRepresentation Learning

  40. Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems

    May 29, 2026Jonathan Colaço Carr, Prakash Panangaden, Doina Precup +1Pairwise Preference LearningMarkov Decision Processes

  41. Learning Kernel-Based MDPs from Episodic Preferential Feedback

    May 22, 2026Nikola Pavlovic, Sattar Vakili, Qing ZhaoPairwise Preference LearningRegret Minimization in RL

  42. From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning

    May 22, 2026Ranxu zhang, zeyang li, Jiacheng Huang +5Agentic RLReinforcement Learning

  43. Token-weighted Direct Preference Optimization with Attention

    May 21, 2026Chengyu Huang, Zhuohang Li, Sheng-Yen Chou +1Pairwise Preference LearningLLM Alignment

  44. Implicit Safety Alignment from Crowd Preferences

    May 20, 2026Qian Lin, Daniel S. BrownSafe RLPreference-Based RL

  45. How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR

    May 20, 2026Richa Verma, Balaraman RavindranDirect Preference OptimizationRL for Language Model Reasoning

  46. PREFINE: Preference-Based Implicit Reward and Cost Fine-Tuning for Safety Alignment

    May 20, 2026Richa Verma, Bavish Kulur, Sanjay Chawla +1Direct Preference OptimizationConstrained RL

  47. General Preference Reinforcement Learning

    May 18, 2026Muhammad Umer, Muhammad Ahmed Mohsin, Ahsan Bilal +5Multi-Objective Language Model AlignmentRL Fine-Tuning

  48. Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation

    May 18, 2026Guining Cao, Jiaxin Peng, Chu Zeng +3Pairwise Preference LearningOpen-Ended Generation

  49. ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks

    May 17, 2026Tianxiang Xu, Xiaoyan Zhu, Xin Lai +1Reward ModelingReinforcement Learning

  50. Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment

    May 17, 2026Yucong Huang, Xiucheng Li, Kaiqi Zhao +1Reward ModelingLLM Alignment

  51. OHP-RL: Online Human Preference as Guidance in Reinforcement Learning for Robot Manipulation

    May 15, 2026Yunyang Mo, Jian Li, Qiwei Wu +2Robotic RLHuman-in-the-Loop AI

  52. Embedding-perturbed Exploration Preference Optimization for Flow Models

    May 15, 2026Sujie Hu, Chubin Chen, Jiashu Zhu +3AI AlignmentGroup Relative Policy Optimization

  53. Distributed Zeroth-Order Policy Gradient for Networked Multi-agent Reinforcement Learning from Human Feedback

    May 15, 2026Pengcheng Dai, He Wang, Dongming Wang +2Policy GradientDecentralized MARL

  54. Driving Intents Amplify Planning-Oriented Reinforcement Learning

    May 12, 2026Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang +4RL for Autonomous DrivingGoal-Conditioned RL