Preference-Based RL

RL: Reinforcement Learning

Momentum

10 papers in the last four weeks, against 2 the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 77

All topics
CardsList
  1. MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization

    May 11, 2026Rohan Surana, Xintong Li, Sheldon Yu +7Direct Preference OptimizationActive Learning

  2. Controllability in preference-conditioned multi-objective reinforcement learning

    May 11, 2026Pau de las Heras Molins, Beyazit Yalcinkaya, Lasse Peters +2Multi-Objective Reinforcement LearningPreference-Based RL

  3. Reinforcement Learning for Scalable and Trustworthy Intelligent Systems

    May 8, 2026Guangchen LanFederated RLPrivacy-Preserving Language Models

  4. Implicit Preference Alignment for Human Image Animation

    May 8, 2026Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng +5Human Motion GenerationHuman Avatar Animation

  5. Multi-Objective Constraint Inference using Inverse reinforcement learning

    May 7, 2026Syed Ihtesham Hussain Shah, Floris den Hengst, Aneta Lisowska +1Reinforcement LearningConstrained RL

  6. Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization

    May 6, 2026Xin Yu, Liuchen Liao, Yiwen Zhang +3On-Policy Self-DistillationLanguage Model Distillation

  7. Data-dependent Exploration for Online Reinforcement Learning from Human Feedback

    May 6, 2026Zhen-Yu Zhang, Yuting Tang, Jiandong Zhang +2RL ExplorationSample-Efficient RL

  8. PrefMoE: Robust Preference Modeling with Mixture-of-Experts Reward Learning

    May 1, 2026Ziqin Yuan, Ruiqi Wang, Dezhong Zhao +2Reward ModelingMixture of Experts

  9. Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design

    Mar 4, 2026Yuxuan Yang, Xiaotong Mao, Jingyao WangLLM AlignmentIndoor Scene Generation

  10. Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment

    Feb 17, 2026Jialu Wang, Heinrich Peters, Asad A. Butt +6LLM AlignmentGroup Relative Policy Optimization

  11. GraphAllocBench: A Flexible Benchmark for Preference-Conditioned Multi-Objective Policy Learning

    Jan 28, 2026Zhiheng Jiang, Yunzhe Wang, Ryan Marr +3Multi-Objective Reinforcement LearningRL Benchmarks

  12. Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

    Oct 2, 2025Derek Shi, Ruben Glatt, Christine Klymko +5Video-Language ModelsRL Fine-Tuning

  13. Learning Acrobatic Flight from Preferences

    Aug 26, 2025Colin Merk, Ismail Geles, Jiaxu Xing +3RL for RoboticsAerial Robotics

  14. Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning

    Jun 14, 2025Sara Rajaram, R. James Cotton, Fabian H. SinzOffline RLRobust RL

  15. Corruption Robust Offline Reinforcement Learning with Human Feedback

    Feb 9, 2024Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban +2Offline RLCorruption Robustness