Preference-Based RL

RL: Reinforcement Learning

Momentum

10 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 77

All topics
CardsList
  1. GAW-PO: Preference Optimization with Gradient-Aligned Token Weights

    Oct 1, 2026Andreea Dutulescu, Stefan Ruseti, Mihai Masala +2LLM AlignmentDirect Preference Optimization

  2. PROMO: Preference-conditioned Multi-Objective Reinforcement Learning for Quadrupedal Robots

    Oct 1, 2026Amr Mousa, Rifny Rachman, Neil Karavis +2Multi-Objective Reinforcement LearningEnergy-Efficient Robot Locomotion

  3. PrefPI: Preference-Guided Steering into Out-of-Distribution Behaviors

    Sep 30, 2026Seungeun Rho, Wontaek Kim, Danfei Xu +1Robot Policy LearningRobot Policy Adaptation

  4. Patient-Centered Treatment Planning for Chronic Multimorbidity: A Hierarchical Reinforcement Learning Framework for Preference Modeling

    Sep 30, 2026Nafiseh Payani, Soham Das, G. Anthony Wilson +1HealthcareHierarchical RL

  5. Robust Risk-Sensitive Reinforcement Learning from Corrupted Human Feedback

    Sep 30, 2026Xinyi Ni, Lifeng LaiRisk-Sensitive RLRobust RL

  6. Revisiting scaling laws for reward optimization

    Sep 29, 2026Ali Aouad, Aymane El Gadarri, Vivek F. FariasReward ModelingReinforcement Learning

  7. On Preference Coverage Collapse from Hindsight Relabeling in Multi-Objective Reinforcement Learning

    Sep 22, 2026Baptiste Bonin, Caro Strickland, Audrey DurandMulti-Objective Reinforcement LearningExperience Replay

  8. The Operable Pareto Front: Distilling Offline Search into Run-Time Control for Multi-Objective UAV Edge-Computing Scheduling

    Sep 16, 2026Qiao Liao, Zhiyong Feng, Bin Wu +1Trajectory OptimizationEdge Computing

  9. Specifying Reward Functions for RL Without Environment Sampling

    Sep 14, 2026Stephane Hatgis-Kessell, W. Bradley Knox, Emma BrunskillLLM-Guided RLReward Design for RL

  10. ALIGN-HOLD: Experience Alignment for Real-Time Hold Control in Large-Scale Ride-Hailing Matching at DiDi

    Sep 9, 2026Zuhao Zhang, Xu Liu, Kai Wan +3RL ControlReward Modeling

  11. Subspace Inference Enables Efficient Active Reward Learning from Preferences

    Sep 3, 2026Yutai Zhou, Erdem BıyıkBayesian RLPreference Learning

  12. Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization

    Aug 10, 2026Wenxiao Zhao, Shu Wang, Ying Nian WuLLM AlignmentDirect Preference Optimization

  13. Multi-Agent Reinforcement Learning via Agent-Specific Preference

    Aug 9, 2026Ni Mu, Yao Luan, Yiqin Yang +1Decentralized MARLCooperative MARL

  14. Why Study Emergent Behavior When You Can Regulate It? Aligning Multi-Agent Systems with Reward Prediction

    Aug 7, 2026Assaf Caftory, Almog Zemach, Moshe Butman +1Multi-Agent Reinforcement LearningEmergent Behavior in Multi-Agent Systems

  15. SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling

    Aug 3, 2026Evan Assmus, Qining Zhang, Lei YingReinforcement LearningRobotic RL

  16. Crayotter: Learning Long-Horizon Video Editing Agents via Group-Relative Preference Backpropagation

    Aug 3, 2026Lecheng Yan, Jianze Lin, Yichong Zhang +5Credit Assignment in RLVideo Editing

  17. LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

    Jul 31, 2026Manith Adikari, Bei Peng, Samuele Vinanzi +1Multi-Objective Reinforcement LearningReinforcement Learning

  18. Learning Latent Reasoning Traces for Scalar Reward Models End-to-End

    Jul 31, 2026Sanwoo Lee, Clive Bai, Hsiu-Yuan Huang +3Reward ModelingLLM Alignment

  19. AutoPref: Automatic Discovery of Task-Specific Preference Objectives for Neural Combinatorial Optimization

    Jul 30, 2026Shengda Gu, Kai Li, Xinyi Ke +3Automated Algorithm DiscoveryPairwise Preference Evaluation

  20. Conservative Query and Adaptive Regularization for Offline RL Under Uncertainty Estimation

    Jul 21, 2026Li-Rong Zhou, Qin-Wen Luo, Sheng-Jun HuangReinforcement LearningOffline RL

  21. Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models

    Jul 14, 2026Ilias Kazantzidis, Timothy J. Norman, Yali Du +1Safe RLReward Design for RL

  22. Deployable Human Preference Alignment in Robotics: Learning Representative Rewards from Diverse Human Preferences

    Jul 14, 2026Taehyung Kim, Gwangmo Lee, Minjun Chang +2ClusteringPreference Alignment

  23. Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability

    Jul 13, 2026Simone Drago, Marco Mussi, Leonardo Bianconi +1Pairwise Preference LearningPairwise Comparison

  24. SPLC: Social Preference Learning for Crowd Robot Navigation

    Jul 2, 2026Zixuan Chen, Hao Fu, Haiwen Hu +1Robot NavigationSocial Robot Navigation

  25. CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning

    Jul 2, 2026Hexian Ni, Tao Lu, Yinghao CaiRobotic RLMultimodal Reward Modeling

  26. VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

    Jul 1, 2026Kuan-Chen Chen, Winston Chen, Wei-Fang Sun +1Multimodal Reward ModelingReward Design for RL

  27. Freeform Preference Learning for Robotic Manipulation

    Jun 30, 2026Marcel Torne, Anubha Mahajan, Abhijnya Bhat +1Long-Horizon Robotic ManipulationRobot Skill Learning