Pairwise Preference Learning

Momentum

12 papers in the last four weeks, up 300% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 81

All topics
CardsList
  1. A Markov Chain Approach to Preference Alignment

    Jun 21, 2026Takuya Koriyama, Tengyuan LiangPairwise Preference LearningPairwise Comparison

  2. Which Pairs to Compare for LLM Post-Training?

    Jun 17, 2026Jiangze Han, Vineet Goyal, Will MaPairwise Preference LearningPairwise Comparison

  3. PrefSQA: Pairwise Preference Prediction for Speech Quality Assessment and the Critical Role of High Quality Datasets

    Jun 17, 2026Junyi Fan, Donald S. WilliamsonPairwise Preference LearningPairwise Preference Evaluation

  4. Learning Robust Pair Confidence for Multimodal Emotion-Cause Pair Extraction

    Jun 17, 2026Zhuangzhuang Pan, Ning Dong, Yingna Su +1Pairwise Preference LearningMultimodal Robustness

  5. Surprise-Guided MergeSort: Budget-Efficient Human-in-the-Loop Ranking via Adaptive Comparison Scheduling

    Jun 14, 2026Yujin Park, Haejun Chung, Ikbeom JangPairwise Preference LearningPairwise Comparison

  6. Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

    Jun 8, 2026Han Zhou, Adam X. Yang, Laurence Aitchison +2Pairwise Preference LearningReward Modeling

  7. DynaCF: Mitigating Shortcut Learning in Reward Models via Dynamic Counterfactual Sensitivity

    Jun 8, 2026Fengyuan Liu, Yongliang Miao, Zirui He +3Pairwise Preference LearningReward Modeling

  8. Sparse Mixture-of-Experts Reward Models Learn Interpretable and Specialized Experts for Personalized Preference Modeling

    Jun 2, 2026Yifan Wang, Jinyi Mu, Mayank Jobanputra +5Pairwise Preference LearningReward Modeling

  9. Follow-Your-Preference++: Rethinking Preference Alignment for Image Inpainting

    Jun 2, 2026Junkun Yuan, Yutao Shen, Toru Aonishi +2Pairwise Preference LearningReward Modeling

  10. Local Preferential Bayesian Optimization

    Jun 1, 2026Johanna Menn, Miriam Kober, Paul Brunzema +2Pairwise Preference LearningPairwise Preference Evaluation

  11. From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning

    May 31, 2026Jun-Jie Yang, Chia-Heng Hsu, Kui-Yuan Chen +1Pairwise Preference LearningRepresentation Learning

  12. Enhancing LLM Metacognition via Cognitive Pairwise Training

    May 30, 2026Weitao Li, Hao Zhou, Xuanyu Lei +11Pairwise Preference LearningRL for Language Model Reasoning

  13. Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems

    May 29, 2026Jonathan Colaço Carr, Prakash Panangaden, Doina Precup +1Pairwise Preference LearningMarkov Decision Processes

  14. The Representation-Rationalizability Tradeoff in Reward Learning

    May 29, 2026Jing Dong, Yaoliang Yu, Pascal PourpartPairwise Preference LearningReward Modeling

  15. Differentially Private Preference Data Synthesis for Large Language Model Alignment

    May 29, 2026Fengyu Gao, Jing YangPairwise Preference LearningLLM Alignment

  16. Reward Learning from Best-of-NN Preference Data: Targets, Tradeoffs, and Design Principles

    May 28, 2026Rattana Pukdee, Maria-Florina Balcan, Pradeep RavikumarPairwise Preference LearningReward Modeling

  17. Active Query Synthesis for Preference Learning

    May 25, 2026Namrata Nadagouda, Nauman Ahad, Maegan Tucker +1Pairwise Preference LearningActive Learning

  18. When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift

    May 25, 2026Khoi Le, Tri Cao, Phong Nguyen +5Pairwise Preference LearningReward Modeling

  19. Learning Kernel-Based MDPs from Episodic Preferential Feedback

    May 22, 2026Nikola Pavlovic, Sattar Vakili, Qing ZhaoPairwise Preference LearningRegret Minimization in RL

  20. Convex Optimization for Alignment and Preference Learning on a Single GPU

    May 22, 2026Miria Feng, Mert PilanciPairwise Preference LearningLLM Alignment

  21. Token-weighted Direct Preference Optimization with Attention

    May 21, 2026Chengyu Huang, Zhuohang Li, Sheng-Yen Chou +1Pairwise Preference LearningLLM Alignment

  22. Beyond Scalar Objectives: Expert-Feedback-Driven Autonomous Experimentation for Scientific Discovery at the Nanoscale

    May 20, 2026Ralph Bulanadi, Jefferey Baxter, Arpan Biswas +5Pairwise Preference LearningActive Learning

  23. Preferences Order, Ratings Anchor: From Fused Expert Aesthetic Ground Truth to Self-Distillation

    May 19, 2026Yuanpei Zhao, Jie Lin, Chao Zhang +5Pairwise Preference LearningPersonalized Image Aesthetics Assessment

  24. Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation

    May 18, 2026Guining Cao, Jiaxin Peng, Chu Zeng +3Pairwise Preference LearningOpen-Ended Generation

  25. Active Learners as Efficient PRP Rerankers

    May 14, 2026Jeremías Figueiredo Paschmann, Juan Kaplan, Francisco Nattero +3Pairwise Preference LearningPairwise Comparison

  26. TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

    May 12, 2026Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van +3Pairwise Preference LearningLLM Alignment

  27. Variance-aware Reward Modeling with Anchor Guidance

    May 12, 2026Shuxing Fang, Ruijian Han, Liangyu Zhang +1Pairwise Preference LearningReward Modeling