Preference Optimization

Momentum

13 papers in the last four weeks, up 30% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 94

All topics
CardsList
  1. RobotAPO: Adversarial Physics Preference Optimization for Robotic Manipulation Video Generation

    Oct 7, 2026Kerui Li, Zhe Jing, Chenyi Huang +4Physical Consistency in Video GenerationRobotic Manipulation

  2. AuraSE: Low-Hallucination Generative Speech Enhancement via Multimodal Flow Matching and Inference Policy Optimization

    Oct 5, 2026Yingda Shen, Yao Qian, Yuxuan Hu +7Inference-Time OptimizationAudio Diffusion Models

  3. Rubric-Based Optimization for Text-to-Music Generation

    Oct 2, 2026Ping Wang, Guang Yang, Shao-Rong Su +3Text-to-Music GenerationRubric-Based RL

  4. Mitigating Social Sycophancy via Pluralistic Preference Optimization

    Oct 1, 2026Stephane Hatgis-Kessell, Myra Cheng, Xiaoxuan Hou +4LLM SycophancyPreference Optimization

  5. GAW-PO: Preference Optimization with Gradient-Aligned Token Weights

    Oct 1, 2026Andreea Dutulescu, Stefan Ruseti, Mihai Masala +2LLM AlignmentDirect Preference Optimization

  6. Uncertainty-Normalized Margins for Direct Preference Optimization

    Sep 29, 2026Sadegh Khorasani, Petrus Mikkola, Matthias GrossglauserPairwise Preference LearningDirect Preference Optimization

  7. Agentic Multi-Turn Reasoning: A Fairness Approach

    Sep 27, 2026Thanh-Dat Truong, Sankalp Pandey, Hugh Churchill +3Preference OptimizationAgentic Reasoning

  8. A Zeroth-Order Paradigm for LLM Preference Alignment

    Sep 16, 2026Peter Chen, Xi Chen, Wotao Yin +1Pairwise Preference LearningLLM Alignment

  9. StalePO: Anchored Token-Level Preference Optimization using Legacy Post-Edits in Machine Translation

    Sep 14, 2026Rohit Dhaipule, Sukhdeep Singh Kharbanda, Prasanth Bathala +2Preference OptimizationLanguage Model Post-Training

  10. Direct Preference Density Alignment for Conversational Audio Equalization

    Sep 14, 2026Ioannis Stylianou, Sven Ewan Shepstone, Jon Francombe +2RL for Language ModelsLLM Alignment

  11. Direct Diversity Optimization for Diverse Successful Trajectories in Preference Post-Training

    Sep 9, 2026Junwon Ko, Dong-Jae Lee, Minchan Kwon +2Offline RLPreference Optimization

  12. Suan: Rectifying Direct Preference Safety Alignment in Large Language Models

    Sep 8, 2026Oleksandr Cherednichenko, Roman KlypaLLM AlignmentLLM Safety Alignment

  13. TV-Regulated OPD: Direction Matters in On-Policy Distillation

    Sep 8, 2026Han Xiao, Yifan Niu, Dongyi Liu +2Preference OptimizationOn-Policy Distillation

  14. CUNO: Curriculum and Preference Optimization for Stable Graph Unlearning under Mass Deletion

    Sep 8, 2026Chenhan Zhang, Ali Braytee, Madhushi Bandara +4Preference OptimizationMachine Unlearning

  15. MARBO: Relational Belief Grounding for LLM Agents in Social Deduction Games

    Sep 6, 2026Yechan Hwang, Sangjun Bae, Jeongmo Kim +2Game-Playing AgentsSocial Deduction Games

  16. FiMI Banking: A Sovereign Model for Indian Retail Banking

    Sep 3, 2026NPCI AI Research Team, Aman Kumar, Asit Desai +15Financial ServicesRL for Language Models

  17. CoMerge: Conflict-Driven Preference Optimization for Multi-Task Model Merging

    Sep 2, 2026Mingjie Zheng, Zihao Chen, Wenqing Chen +4Model MergingPreference Optimization

  18. Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation

    Sep 1, 2026Thibaut Thonet, Jos Rozen, Laurent BesacierLLM AlignmentTTS Evaluation

  19. Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization

    Aug 31, 2026Camila Blank, Zhuofan Ying, Christopher Potts +2LLM SycophancyEmergent Misalignment in Language Models

  20. Balancing Privacy, Utility, and Safety in LLM Alignment through Preference Optimization

    Aug 31, 2026Dishu Yang, Jingjing Liu, Jize LiLLM AlignmentMemorization in Language Models

  21. VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

    Aug 13, 2026Wenxiang Guo, Changhao Pan, Ziyue Jiang +2Text-to-Audio GenerationPreference Optimization

  22. SSPO: Structure-Aware Similarity-Weighted Preference Optimization for Neural Combinatorial Optimization

    Aug 12, 2026Yuanyu Li, Jintao Xu, Zijiang Liu +6Combinatorial OptimizationPreference Optimization

  23. Learning Sexism Detection Using Multi-Agent Perspectivist Preference Optimization

    Aug 4, 2026Hadi Mohammadi, Tina Shahedi, Robert A. Bagheri +2Annotator DisagreementPreference Optimization

  24. Cloud-ScPO: Hidden-State Geometry for Semi-Supervised Preference Optimization in LLM Reasoning

    Aug 2, 2026Yuzhou Liu, Xiyang HuPreference OptimizationSemi-Supervised Learning

  25. Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion

    Jul 30, 2026Henglin Liu, Fangyuan Kong, Jing Wang +7Diffusion Model AlignmentVideo Diffusion Models

  26. AutoPref: Automatic Discovery of Task-Specific Preference Objectives for Neural Combinatorial Optimization

    Jul 30, 2026Shengda Gu, Kai Li, Xinyi Ke +3Automated Algorithm DiscoveryPairwise Preference Evaluation

  27. BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences

    Jul 29, 2026Ru Peng, Haokai Xu, Xijun Gu +11Pairwise Preference LearningPreference Optimization

  28. TELLER: Dual-Path Iterative Preference Optimization for Table Entity Linking

    Jul 29, 2026Yixin Peng, Kehao Li, Stefan DeckerDirect Preference OptimizationPreference Optimization

  29. Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization

    Jul 27, 2026Zhengtao Yao, Runhao Li, Xupeng Chen +12Preference Optimization

  30. RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation

    Jul 17, 2026Pei Tian, Zihan Dong, Tianci Liu +2Retrieval-Augmented GenerationSmall Language Models

  31. TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue

    Jul 17, 2026Shuzhong Lai, Junhong Lai, Chenxi Li +5LLM SycophancyDirect Preference Optimization

  32. Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

    Jul 15, 2026Zhixiao Zheng, Zheren Fu, Zhiyuan Yao +3Multimodal GroundingMultimodal Large Language Models

  33. Exploring Post-Training Alignment of Small Language Models for Biomedical Data-to-Text Generation: A Case Study of Medication Leaflet

    Jul 15, 2026Xi Yang, Guodong Liu, Chuqin Li +10LLM AlignmentSmall Language Models

  34. Direct Image-to-Modern Vietnamese Translation of Han-Nom Manuscripts via Multimodal RLHF Preference Alignment

    Jul 13, 2026Thi Kim Trang Vo, Nghia Hieu Nguyen, Ha Minh TanDirect Preference OptimizationPreference Optimization

  35. PORTS: Preference-Optimized Retrievers for Tool Selection with Large Language Models

    Jul 3, 2026Lorenzo Molfetta, Giacomo Frisoni, Nicolò Monaldini +1Preference OptimizationLLM Tool Use

  36. Distributionally Robust Listwise Preference Optimization

    Jul 2, 2026Xudong Wu, Jian Qian, Pangpang Liu +2LLM AlignmentDistributionally Robust Optimization

  37. RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

    Jun 26, 2026Yelin Wang, Zijia Song, Shuo Ye +6Remote Sensing Image UnderstandingVLM Adaptation

  38. OracleAnalyser: Analysing Implicit Semantics of Oracle Bone Scripts through MLLMs with Post-training

    Jun 24, 2026Zijia Song, Yelin Wang, Zhengyi Ma +5VLM ReasoningPreference Optimization

  39. Beyond Uniform Forgetting: A Study of Sequential Direct Preference Optimization Across Preference Settings

    Jun 18, 2026Pranav Bhandari, Nicolas Fay, Amitava Datta +2Continual Learning for LLMsDirect Preference Optimization

  40. Temporal Preference Optimization for Unsupervised Retrieval

    Jun 16, 2026HyunJin Kim, Jaejun Shim, Young Jin Kim +1Temporal IRPreference Optimization

  41. PVminerLLM2: Improving Structured Extraction of Patient Voice via Preference Optimization

    Jun 15, 2026Samah Fodeh, Linhai Ma, Ganesh Puthiaraju +7HealthcareClinical Information Extraction

  42. PolyAlign: Conditional Human-Distribution Alignment

    Jun 11, 2026L. D. M. S. Sai Teja, Ufaq Khan, Sathira Silva +2Multilingual Language ModelsLLM Alignment

  43. Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech

    Jun 11, 2026Yihang Lin, Li Zhou, Congwei Cao +4TTS SynthesisPreference Optimization

  44. FoA-SR: Faithful or Aesthetic? Profile-Aware Preference Optimization for Real-World Image Super-Resolution

    Jun 9, 2026Amjad Mahdi Alqarni, Peizhong JuDiffusion Models for Image RestorationPreference Optimization

  45. ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning

    Jun 2, 2026Ziyan Liu, Xueda Shen, Yuzhe Gu +7Efficient Language Model ReasoningPreference Optimization

  46. Drifting Preference Optimization for One-Step Generative Models

    Jun 1, 2026Zhou Jiang, Yandong Wen, Zhen LiuDiffusion Model AlignmentOne-Step Generative Modeling

  47. Human Label Variation as Stable Signal: Learning Annotator-Specific Explanation Behavior via Cross-Annotator Preference Optimization

    May 27, 2026Beiduo Chen, Pingjun Hong, Ziyun Zhang +3LLM-Assisted AnnotationPreference Optimization