Preference Optimization

Momentum

13 papers in the last four weeks, up 30% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 98

All topics
CardsList
  1. Hallucination Detection-Guided Preference Optimization for Clinical Summarization

    May 27, 2026Shamanth Kuthpadi Seethakantha, Dung Ngoc Thai, Vara Prasad Gudi +6LLM Self-RefinementLLM Hallucination Mitigation

  2. Convex Optimization for Alignment and Preference Learning on a Single GPU

    May 22, 2026Miria Feng, Mert PilanciPairwise Preference LearningLLM Alignment

  3. Token-weighted Direct Preference Optimization with Attention

    May 21, 2026Chengyu Huang, Zhuohang Li, Sheng-Yen Chou +1Pairwise Preference LearningLLM Alignment

  4. TO-Agents: A Multi-Agent AI Pipeline for Preference-Guided Topology Optimization

    May 20, 2026Isabella A. Stewart, Hongrui Chen, Faez AhmedTopology OptimizationMulti-Agent System Optimization

  5. Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment

    May 20, 2026Zhiqin Yang, Yonggang Zhang, Wei Xue +3LLM AlignmentDirect Preference Optimization

  6. WeCon: An Efficient Weight-Conditioned Neural Solver for Multi-Objective Combinatorial Optimization Problems

    May 20, 2026Xuan Wu, Jinbiao Chen, Yang Li +7Preference OptimizationMulti-Objective Optimization

  7. TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

    May 12, 2026Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van +3Pairwise Preference LearningLLM Alignment

  8. StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models

    May 12, 2026Ishmam Khan, Sindhuja Thogarrati, Shuo ZhangLLM AlignmentLLM Fine-Tuning

  9. Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping

    May 11, 2026Haoyuan Sun, Jing Wang, Yuxin Song +9Reward HackingPreference Optimization

  10. DGPO: Beyond Pairwise Preferences with Directional Consistent Groupwise Optimization

    May 11, 2026Mengyi Deng, Zhiwei Li, Xin Li +4LLM AlignmentReasoning Consistency in Language Models

  11. MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization

    May 11, 2026Rohan Surana, Xintong Li, Sheldon Yu +7Direct Preference OptimizationActive Learning

  12. Mechanistic Analysis of Alignment Algorithms in Language Models

    May 9, 2026Aarush Sinha, Ishan Garg, Veeraraju Elluru +2LLM InterpretabilityMechanistic Interpretability

  13. ξξ-DPO: Direct Preference Optimization via Ratio Reward Margin

    May 9, 2026Zhengyuan Fan, Zhonghua Wu, Yuxuan Du +1Pairwise Preference LearningDirect Preference Optimization

  14. Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models

    May 7, 2026Zhikai Li, Yue Zhao, Edward Zhongwei Zhang +4Diffusion Model AlignmentPreference Optimization

  15. Towards General Preference Alignment: Diffusion Models at Nash Equilibrium

    May 6, 2026Jiaming Hu, Jiamu Bai, Haoyu Wang +2Diffusion Model AlignmentPreference Optimization

  16. Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models

    May 5, 2026Shule Lu, Yujing Wang, Hainan Zhang +5Reward ModelingPreference Optimization

  17. DynamicPO: Dynamic Preference Optimization for Recommendation

    May 1, 2026Xingyu Hu, Kai Zhang, Jiancan Wu +7Hard Negative MiningPreference Optimization

  18. ViPO: Visual Preference Optimization at Scale

    Apr 27, 2026Ming Li, Jie Wu, Justin Cui +3Diffusion Model AlignmentDirect Preference Optimization

  19. Hindsight Preference Optimization for Financial Time Series Advisory

    Apr 27, 2026Yanwei Cui, Guanghui Wang, Xing Zhang +7LLM AlignmentFinancial Forecasting

  20. Align Generative Artificial Intelligence with Human Preferences: A Novel Large Language Model Fine-Tuning Method for Online Review Management

    Apr 23, 2026Yanan Wang, Yong GeLLM Hallucination MitigationLLM Fine-Tuning

  21. HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

    Apr 22, 2026Darsh Kachroo, Arjun Prasaath Anbazhagan, Adriana Caraeni +2LLM AlignmentDirect Preference Optimization

  22. Towards Disentangled Preference Optimization Dynamics: Suppress the Loser, Preserve the Winner

    Apr 20, 2026Wei Chen, Yubing Wu, Junmei Yang +5Pairwise Preference LearningLLM Alignment

  23. GroupDPO: Memory-Efficient Group-Wise Direct Preference Optimization

    Apr 17, 2026Jixuan Leng, Si Si, Hsiang-Fu Yu +2LLM AlignmentDirect Preference Optimization

  24. Auditing Multi-Agent LLM Reasoning Trees Outperforms Majority Vote and LLM-as-Judge

    Feb 10, 2026Wei Yang, Shixuan Li, Heng Ping +3LLM AuditingPreference Optimization

  25. Not All Preferences Deserve Gradients: Understanding Gradient Utility in Offline Reasoning Alignment

    Feb 1, 2026Hui Wu, Hengyi Cai, Jinman Zhao +6Pairwise Preference LearningTraining Data Selection