Multi-Objective Language Model Alignment

Latest papers 62

All topics
CardsList
  1. What Do People Actually Want From AI? Mapping Preference Plurality

    Jun 4, 2026Julia Sepúlveda Coelho, Scott A. HaleLLM AlignmentHuman Preference Modeling

  2. TriAlign: Towards Universal Truth Consistency in Personalized LLM Alignment

    Jun 1, 2026Thi-Nhung Nguyen, Linhao Luo, Rollin Omari +3LLM AlignmentAlgorithmic Fairness

  3. Configurable Reward Model for Balanced Safety Alignment

    May 28, 2026Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj +5Reward ModelingLanguage Model Safety Evaluation

  4. EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation

    May 28, 2026Xin Guan, Xiaomeng Hu, Shen Huang +6Open-Ended GenerationRL for Language Models

  5. Multi-Stakeholder LLM Alignment: Decomposing Estimation from Aggregation

    May 26, 2026Lulu Zheng, Wenjin Yang, Xiangwen Zhang +4LLM AlignmentLLM-as-a-Judge

  6. MATO: Multi-objective Personalized Alignment with Test-time Optimization for Large Language Models

    May 25, 2026Linhao Luo, Thuy-Trang Vu, Van-Anh Nguyen +3LLM AlignmentInference-Time Optimization

  7. Spectral Souping: A Unified Framework for Online Preference Alignment

    May 19, 2026Yinlam Chow, Guy Tennenholtz, Ted Yun +4Multi-Objective Language Model AlignmentPreference Alignment

  8. General Preference Reinforcement Learning

    May 18, 2026Muhammad Umer, Muhammad Ahmed Mohsin, Ahsan Bilal +5Multi-Objective Language Model AlignmentRL Fine-Tuning

  9. Improving Code Translation with Syntax-Guided and Semantic-aware Preference Optimization

    May 13, 2026Yuhan Wu, Huan Zhang, Wei Cheng +3Code TranslationDirect Preference Optimization

  10. Pareto-Guided Optimal Transport for Multi-Reward Alignment

    May 13, 2026Ying Ba, Tianyu Zhang, Mohan Zhou +5Diffusion Model AlignmentReward Hacking

  11. BSO: Safety Alignment Is Density Ratio Matching

    May 12, 2026Tien-Phat Nguyen, Truong Nguyen, Thin Nguyen +3Functional Bregman DivergencesDirect Preference Optimization

  12. Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion

    May 12, 2026ShiYing Huang, Liang Lin, Yuer Li +6LLM Safety AlignmentMulti-Objective Language Model Alignment

  13. Macro: Enhancing Multilingual Counterfactual Explanations through Alignment-as-Preference Optimization

    May 12, 2026Yilong Wang, Qianli Wang, Bohao Chu +3Multilingual Language ModelsCounterfactual Explanations

  14. ProteinOPD: Towards Effective and Efficient Preference Alignment for Protein Design

    May 11, 2026Yulin Zhang, He Cao, Zihao Jiang +6Protein Language ModelsMulti-Teacher Knowledge Distillation

  15. SalesSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

    May 8, 2026Yada Pruksachatkun, Elaine Wan, Lyanna Chen +2RL for Language ModelsLarge Language Model-Based Role-Play Simulation

  16. TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization

    Apr 30, 2026Abdulhady Abas Abdullah, Fatemeh Daneshfar, Seyedali Mirjalili +1LLM AlignmentDirect Preference Optimization

  17. A Multi-Dimensional Audit of Politically Aligned Large Language Models

    Apr 27, 2026Lisa Korver, Mohamed Mostagir, Sherief RedaLLM AuditingPolitical Bias in Language Models

  18. Pref-CTRL: Preference Driven LLM Alignment using Representation Editing

    Apr 26, 2026Imranul Ashrafi, Inigo Jauregi Unanue, Massimo PiccardiLLM AlignmentRepresentation Engineering

  19. C-MORAL: Controllable Multi-Objective Molecular Optimization with Reinforcement Alignment for LLMs

    Apr 24, 2026Rui Gao, Youngseung Jeon, Swastik Roy +2RL for Language ModelsMolecular Optimization

  20. MGDA-Decoupled: Geometry-Aware Multi-Objective Optimisation for DPO-based LLM Alignment

    Apr 22, 2026Andor Vári-Kakas, Ji Won Park, Natasa TagasovskaDirect Preference OptimizationGradient Descent

  21. Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization

    Apr 19, 2026Xiaoyong Mei, Tingting Zuo, Da Chen +5Text SummarizationMulti-Objective Language Model Alignment

  22. WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training

    Apr 16, 2026Yifu Chen, Shengpeng Ji, Qian Chen +9Spoken Dialogue SystemsMulti-Objective Language Model Alignment

  23. Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning

    Feb 14, 2026Yanbo Wang, Minzheng Wang, Jian Liang +3LLM AlignmentRL for Language Model Reasoning

  24. VISPA: Pluralistic Alignment via Automatic Value Selection and Activation

    Jan 19, 2026Shenyan Zheng, Jiayou Zhong, Anudeex Shetty +3LLM AlignmentMulti-Objective Language Model Alignment