Pairwise Preference Learning

Momentum

12 papers in the last four weeks, up 300% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 81

All topics
CardsList
  1. Covariate-dependent Joint Modeling of Multivariate Ordinal Preferences and Its Connections with Comparison Models

    Oct 6, 2026Yujie Chen, Antik Chakraborty, Anindya BhadraPreference LearningOrdinal Regression

  2. Groupwise Distortion Guarantees for Preference-Based Alignment

    Oct 4, 2026Jacob Brodkey, Roberto Tamez, Aaron RothPairwise Preference LearningSocial Choice Theory

  3. On the Complexity of Preference-Based Bandits

    Sep 30, 2026Ahmed Ben Yahmed, Marc Abeille, Clément CalauzènesPairwise Preference LearningMulti-Armed Bandits

  4. Optimal Design for Active Preference Learning with Biased LLM Judges

    Sep 30, 2026Zhongman Du, Huiming Zhang, Haodong Zhu +1Pairwise Preference LearningLLM Alignment

  5. Uncertainty-Normalized Margins for Direct Preference Optimization

    Sep 29, 2026Sadegh Khorasani, Petrus Mikkola, Matthias GrossglauserPairwise Preference LearningDirect Preference Optimization

  6. Using Context Is Not Enough: Test-Time Training for Personalized Reward Modeling

    Sep 28, 2026Bohao Wang, Xiaoyan Zhao, Yang Zhang +4Pairwise Preference LearningReward Modeling

  7. From Soft Targets to Reward Signals: How Assignment and Reward Objectives Interact

    Sep 28, 2026Jiangtao Lin, Bangyang Wei, Siyi Liu +2Pairwise Preference LearningReward Modeling

  8. PrefLUT: Reusable and Refinable Personalized Color Editing from Pairwise Preferences

    Sep 28, 2026Chuanzhi Xu, Langyi Chen, Chengkun Yue +5Pairwise Preference LearningUser Preference Modeling

  9. A Zeroth-Order Paradigm for LLM Preference Alignment

    Sep 16, 2026Peter Chen, Xi Chen, Wotao Yin +1Pairwise Preference LearningLLM Alignment

  10. Learning Heterogeneous Preferences

    Sep 15, 2026Shiwali Mohan, Matt Hong, Dule Shu +3Pairwise Preference LearningHuman Preference Modeling

  11. FlowCPO: A Unified Divergence View of Preference Alignment for Flow Models

    Sep 9, 2026Yansen Han, Shengyi Liao, Peng Sun +4Pairwise Preference LearningFlow Matching

  12. Finding the Signal in the Spam: Jointly Learning Rewards and Worker Reliability from Pairwise Comparisons

    Aug 10, 2026Kaustubh Shivshankar Shejole, Tanish Agarwal, Arpit Agarwal +1Pairwise Preference LearningReward Modeling

  13. Isotonic Bradley-Terry Model for Paired Comparison Data

    Aug 3, 2026Ryoya YamasakiPairwise Preference LearningPairwise Comparison

  14. Rethinking Personalized Reward Modeling for LLMs under Preference Heterogeneity via Group-Debiased Federated Learning

    Aug 3, 2026Seongyoon Kim, Boryeong Cho, Jihwan Oh +2Pairwise Preference LearningReward Modeling

  15. Ranking Infrared-Visible Fusion the Way Humans Do: A Learned Pairwise Preference Measure

    Aug 2, 2026Haoran Liu, Mingzhe Liu, Peng Li +1Pairwise Preference LearningMulti-Source Image Fusion

  16. BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences

    Jul 29, 2026Ru Peng, Haokai Xu, Xijun Gu +11Pairwise Preference LearningPreference Optimization

  17. CSPF: A Constrained Shared-Private Fusion Method for Non-Verifiable Preference Evaluation

    Jul 23, 2026Hehao Zhang, Danli Wang, Xinyuan Wang +1Pairwise Preference LearningReward Modeling

  18. Generalizing Preference-based Reinforcement Learning: a Rationality Model for Incomparability

    Jul 13, 2026Simone Drago, Marco Mussi, Leonardo Bianconi +1Pairwise Preference LearningPairwise Comparison

  19. Comparison-Based Ordinal Learning for Proactive Driving Risk Assessment

    Jul 13, 2026Zhuoren Li, Yi Zhong, Weiqi Zhang +4Pairwise Preference LearningCollision Avoidance

  20. Optimal Top-kk Identification from Pairwise Comparisons

    Jul 9, 2026Motti Goldberger, Nils RudiPairwise Preference LearningMulti-Armed Bandits

  21. Attention Limited Reward Learning

    Jul 6, 2026Wenqian XingPairwise Preference LearningReward Modeling

  22. Unbiased Alignment for Large Language Models with Noisy Preferences

    Jul 3, 2026Jialiang Wang, Xianming Liu, Xiong Zhou +2Pairwise Preference LearningLLM Alignment

  23. A Markov Chain Approach to Preference Alignment

    Jun 21, 2026Takuya Koriyama, Tengyuan LiangPairwise Preference LearningPairwise Comparison

  24. Which Pairs to Compare for LLM Post-Training?

    Jun 17, 2026Jiangze Han, Vineet Goyal, Will MaPairwise Preference LearningPairwise Comparison

  25. PrefSQA: Pairwise Preference Prediction for Speech Quality Assessment and the Critical Role of High Quality Datasets

    Jun 17, 2026Junyi Fan, Donald S. WilliamsonPairwise Preference LearningPairwise Preference Evaluation

  26. Learning Robust Pair Confidence for Multimodal Emotion-Cause Pair Extraction

    Jun 17, 2026Zhuangzhuang Pan, Ning Dong, Yingna Su +1Pairwise Preference LearningMultimodal Robustness

  27. Surprise-Guided MergeSort: Budget-Efficient Human-in-the-Loop Ranking via Adaptive Comparison Scheduling

    Jun 14, 2026Yujin Park, Haejun Chung, Ikbeom JangPairwise Preference LearningPairwise Comparison

  28. Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

    Jun 8, 2026Han Zhou, Adam X. Yang, Laurence Aitchison +2Pairwise Preference LearningReward Modeling

  29. DynaCF: Mitigating Shortcut Learning in Reward Models via Dynamic Counterfactual Sensitivity

    Jun 8, 2026Fengyuan Liu, Yongliang Miao, Zirui He +3Pairwise Preference LearningReward Modeling

  30. Sparse Mixture-of-Experts Reward Models Learn Interpretable and Specialized Experts for Personalized Preference Modeling

    Jun 2, 2026Yifan Wang, Jinyi Mu, Mayank Jobanputra +5Pairwise Preference LearningReward Modeling

  31. Follow-Your-Preference++: Rethinking Preference Alignment for Image Inpainting

    Jun 2, 2026Junkun Yuan, Yutao Shen, Toru Aonishi +2Pairwise Preference LearningReward Modeling

  32. Local Preferential Bayesian Optimization

    Jun 1, 2026Johanna Menn, Miriam Kober, Paul Brunzema +2Pairwise Preference LearningPairwise Preference Evaluation

  33. From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning

    May 31, 2026Jun-Jie Yang, Chia-Heng Hsu, Kui-Yuan Chen +1Pairwise Preference LearningRepresentation Learning

  34. Enhancing LLM Metacognition via Cognitive Pairwise Training

    May 30, 2026Weitao Li, Hao Zhou, Xuanyu Lei +11Pairwise Preference LearningRL for Language Model Reasoning

  35. Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems

    May 29, 2026Jonathan Colaço Carr, Prakash Panangaden, Doina Precup +1Pairwise Preference LearningMarkov Decision Processes

  36. The Representation-Rationalizability Tradeoff in Reward Learning

    May 29, 2026Jing Dong, Yaoliang Yu, Pascal PourpartPairwise Preference LearningReward Modeling

  37. Differentially Private Preference Data Synthesis for Large Language Model Alignment

    May 29, 2026Fengyu Gao, Jing YangPairwise Preference LearningLLM Alignment

  38. Reward Learning from Best-of-NN Preference Data: Targets, Tradeoffs, and Design Principles

    May 28, 2026Rattana Pukdee, Maria-Florina Balcan, Pradeep RavikumarPairwise Preference LearningReward Modeling

  39. Active Query Synthesis for Preference Learning

    May 25, 2026Namrata Nadagouda, Nauman Ahad, Maegan Tucker +1Pairwise Preference LearningActive Learning

  40. When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift

    May 25, 2026Khoi Le, Tri Cao, Phong Nguyen +5Pairwise Preference LearningReward Modeling

  41. Learning Kernel-Based MDPs from Episodic Preferential Feedback

    May 22, 2026Nikola Pavlovic, Sattar Vakili, Qing ZhaoPairwise Preference LearningRegret Minimization in RL

  42. Convex Optimization for Alignment and Preference Learning on a Single GPU

    May 22, 2026Miria Feng, Mert PilanciPairwise Preference LearningLLM Alignment

  43. Token-weighted Direct Preference Optimization with Attention

    May 21, 2026Chengyu Huang, Zhuohang Li, Sheng-Yen Chou +1Pairwise Preference LearningLLM Alignment

  44. Beyond Scalar Objectives: Expert-Feedback-Driven Autonomous Experimentation for Scientific Discovery at the Nanoscale

    May 20, 2026Ralph Bulanadi, Jefferey Baxter, Arpan Biswas +5Pairwise Preference LearningActive Learning

  45. Preferences Order, Ratings Anchor: From Fused Expert Aesthetic Ground Truth to Self-Distillation

    May 19, 2026Yuanpei Zhao, Jie Lin, Chao Zhang +5Pairwise Preference LearningPersonalized Image Aesthetics Assessment

  46. Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation

    May 18, 2026Guining Cao, Jiaxin Peng, Chu Zeng +3Pairwise Preference LearningOpen-Ended Generation

  47. Active Learners as Efficient PRP Rerankers

    May 14, 2026Jeremías Figueiredo Paschmann, Juan Kaplan, Francisco Nattero +3Pairwise Preference LearningPairwise Comparison

  48. TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

    May 12, 2026Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van +3Pairwise Preference LearningLLM Alignment

  49. Variance-aware Reward Modeling with Anchor Guidance

    May 12, 2026Shuxing Fang, Ruijian Han, Liangyu Zhang +1Pairwise Preference LearningReward Modeling