Sequential Preference Optimization

Latest papers 32

All topics
CardsList
  1. A Zeroth-Order Paradigm for LLM Preference Alignment

    Sep 16, 2026Peter Chen, Xi Chen, Wotao Yin +1Preference AlignmentSequential Preference Optimization

  2. DiaWhisper-DPO: Role-Attributed Transcription of Clinical Interviews via Failure-Mined Preference Optimization

    Sep 15, 2026Weiming Li, Ana Catarina Fidalgo Barata, Miguel Constante +1Speaker DiarizationTranscript

  3. Suan: Rectifying Direct Preference Safety Alignment in Large Language Models

    Sep 8, 2026Oleksandr Cherednichenko, Roman KlypaSafety AlignmentLarge Language Model Alignment

  4. Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

    Aug 12, 2026Byungoh Ko, Jinyoung Park, Jongha Kim +3Hallucination MitigationObject Hallucination

  5. Positive-Unlabeled Preference Optimization For Chest X-ray Report Generation

    Aug 5, 2026Yuta Kobayashi, Pradyun Ramesh, Muhammad Ahmed Chaudhry +5Radiology Report GenerationMedical Vision-Language Models

  6. Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion

    Jul 30, 2026Henglin Liu, Fangyuan Kong, Jing Wang +7Text-To-Video Diffusion ModelsVideo Diffusion Models

  7. TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue

    Jul 17, 2026Shuzhong Lai, Junhong Lai, Chenxi Li +5Autism Spectrum DisorderSycophancy

  8. Distributionally Robust Listwise Preference Optimization

    Jul 2, 2026Xudong Wu, Jian Qian, Pangpang Liu +2Sequential Preference OptimizationBacktranslation Augmented Direct Preference Optimization

  9. Steerable Cultural Preference Optimization of Reward Models

    Jun 17, 2026Minsik Oh, Advit Deepak, Sophie Wu +2Large Language Model AlignmentSequential Preference Optimization

  10. Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization

    Jun 15, 2026Junyi Li, Xiaowei Qian, Yingyi Zhang +6Sequential Preference OptimizationLarge Language Model Alignment

  11. Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs

    Jun 10, 2026Shayan Mohammadizadehsamakosh, Pritam Sarkar, Leonid Sigal +2Medical Vision-Language ModelsVision-Language Alignment

  12. A Regret Minimization Framework on Preference Learning in Large Language Models

    Jun 8, 2026Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim +4Reinforcement Learning From Human FeedbackSequential Preference Optimization

  13. Local Preferential Bayesian Optimization

    Jun 1, 2026Johanna Menn, Miriam Kober, Paul Brunzema +2Multi-Objective Bayesian Optimization AlgorithmsBayesian Optimization

  14. Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization

    May 27, 2026Jiawei Kong, Hao Fang, Shunxiang Liao +5Multimodal ReasoningHallucination Mitigation

  15. TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

    May 12, 2026Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van +3Sequential Preference OptimizationToken-Level Uncertainty

  16. Confidence-Aware Alignment Makes Reasoning LLMs More Reliable

    May 8, 2026Kejia Chen, Jiawen Zhang, Yihong Wu +5LLM Reasoning StrategiesSequential Preference Optimization

  17. Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference Optimization

    May 8, 2026Yurui Pan, Ke Xu, Bo PengLarge Language Model AlignmentSequential Preference Optimization

  18. Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models

    May 7, 2026Zhikai Li, Yue Zhao, Edward Zhongwei Zhang +4Diffusion-Based Reinforcement Learning MethodsDiffusion Models

  19. A Finite Time Analysis of Thompson Sampling for Bayesian Optimization with Preferential Feedback

    Apr 27, 2026Joseph Lazzaro, Davide Buffelli, Da-shan Shiu +1Thompson SamplingBayesian Optimization

  20. Hindsight Preference Optimization for Financial Time Series Advisory

    Apr 27, 2026Yanwei Cui, Guanghui Wang, Xing Zhang +7Sequential Preference OptimizationLarge Language Model Adaptation

  21. HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

    Apr 22, 2026Darsh Kachroo, Arjun Prasaath Anbazhagan, Adriana Caraeni +2Sequential Preference OptimizationLLM Reasoning Strategies

  22. S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models

    Apr 20, 2026Nitish Shukla, Surgan Jandial, Arun RossMultiple Vision TasksSequential Preference Optimization

  23. Towards Disentangled Preference Optimization Dynamics: Suppress the Loser, Preserve the Winner

    Apr 20, 2026Wei Chen, Yubing Wu, Junmei Yang +5Sequential Preference OptimizationIncentives

  24. Shapley-based Data Valuation for LLM Alignment via Sequential Preference Optimization

    Dec 12, 2025Mélissa Tamine, Otmane Sakhi, Benjamin Heymann +2Large Language Model AlignmentSequential Preference Optimization