Preference Optimization

Momentum

13 papers in the last four weeks, up 30% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 98

All topics
CardsList
  1. RobotAPO: Adversarial Physics Preference Optimization for Robotic Manipulation Video Generation

    Oct 7, 2026Kerui Li, Zhe Jing, Chenyi Huang +4Physical Consistency in Video GenerationRobotic Manipulation

  2. AuraSE: Low-Hallucination Generative Speech Enhancement via Multimodal Flow Matching and Inference Policy Optimization

    Oct 5, 2026Yingda Shen, Yao Qian, Yuxuan Hu +7Inference-Time OptimizationAudio Diffusion Models

  3. Rubric-Based Optimization for Text-to-Music Generation

    Oct 2, 2026Ping Wang, Guang Yang, Shao-Rong Su +3Text-to-Music GenerationRubric-Based RL

  4. Mitigating Social Sycophancy via Pluralistic Preference Optimization

    Oct 1, 2026Stephane Hatgis-Kessell, Myra Cheng, Xiaoxuan Hou +4LLM SycophancyPreference Optimization

  5. GAW-PO: Preference Optimization with Gradient-Aligned Token Weights

    Oct 1, 2026Andreea Dutulescu, Stefan Ruseti, Mihai Masala +2LLM AlignmentDirect Preference Optimization

  6. Uncertainty-Normalized Margins for Direct Preference Optimization

    Sep 29, 2026Sadegh Khorasani, Petrus Mikkola, Matthias GrossglauserPairwise Preference LearningDirect Preference Optimization

  7. Agentic Multi-Turn Reasoning: A Fairness Approach

    Sep 27, 2026Thanh-Dat Truong, Sankalp Pandey, Hugh Churchill +3Preference OptimizationAgentic Reasoning

  8. A Zeroth-Order Paradigm for LLM Preference Alignment

    Sep 16, 2026Peter Chen, Xi Chen, Wotao Yin +1Pairwise Preference LearningLLM Alignment

  9. StalePO: Anchored Token-Level Preference Optimization using Legacy Post-Edits in Machine Translation

    Sep 14, 2026Rohit Dhaipule, Sukhdeep Singh Kharbanda, Prasanth Bathala +2Preference OptimizationLanguage Model Post-Training

  10. Direct Preference Density Alignment for Conversational Audio Equalization

    Sep 14, 2026Ioannis Stylianou, Sven Ewan Shepstone, Jon Francombe +2RL for Language ModelsLLM Alignment

  11. Direct Diversity Optimization for Diverse Successful Trajectories in Preference Post-Training

    Sep 9, 2026Junwon Ko, Dong-Jae Lee, Minchan Kwon +2Offline RLPreference Optimization

  12. Suan: Rectifying Direct Preference Safety Alignment in Large Language Models

    Sep 8, 2026Oleksandr Cherednichenko, Roman KlypaLLM AlignmentLLM Safety Alignment

  13. TV-Regulated OPD: Direction Matters in On-Policy Distillation

    Sep 8, 2026Han Xiao, Yifan Niu, Dongyi Liu +2Preference OptimizationOn-Policy Distillation

  14. CUNO: Curriculum and Preference Optimization for Stable Graph Unlearning under Mass Deletion

    Sep 8, 2026Chenhan Zhang, Ali Braytee, Madhushi Bandara +4Preference OptimizationMachine Unlearning

  15. MARBO: Relational Belief Grounding for LLM Agents in Social Deduction Games

    Sep 6, 2026Yechan Hwang, Sangjun Bae, Jeongmo Kim +2Game-Playing AgentsSocial Deduction Games

  16. FiMI Banking: A Sovereign Model for Indian Retail Banking

    Sep 3, 2026NPCI AI Research Team, Aman Kumar, Asit Desai +15Financial ServicesRL for Language Models

  17. CoMerge: Conflict-Driven Preference Optimization for Multi-Task Model Merging

    Sep 2, 2026Mingjie Zheng, Zihao Chen, Wenqing Chen +4Model MergingPreference Optimization

  18. Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation

    Sep 1, 2026Thibaut Thonet, Jos Rozen, Laurent BesacierLLM AlignmentTTS Evaluation

  19. Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization

    Aug 31, 2026Camila Blank, Zhuofan Ying, Christopher Potts +2LLM SycophancyEmergent Misalignment in Language Models

  20. Balancing Privacy, Utility, and Safety in LLM Alignment through Preference Optimization

    Aug 31, 2026Dishu Yang, Jingjing Liu, Jize LiLLM AlignmentMemorization in Language Models

  21. VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

    Aug 13, 2026Wenxiang Guo, Changhao Pan, Ziyue Jiang +2Text-to-Audio GenerationPreference Optimization

  22. SSPO: Structure-Aware Similarity-Weighted Preference Optimization for Neural Combinatorial Optimization

    Aug 12, 2026Yuanyu Li, Jintao Xu, Zijiang Liu +6Combinatorial OptimizationPreference Optimization

  23. Learning Sexism Detection Using Multi-Agent Perspectivist Preference Optimization

    Aug 4, 2026Hadi Mohammadi, Tina Shahedi, Robert A. Bagheri +2Annotator DisagreementPreference Optimization

  24. Cloud-ScPO: Hidden-State Geometry for Semi-Supervised Preference Optimization in LLM Reasoning

    Aug 2, 2026Yuzhou Liu, Xiyang HuPreference OptimizationSemi-Supervised Learning