LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. What Do People Actually Want From AI? Mapping Preference Plurality

    Jun 4, 2026Julia Sepúlveda Coelho, Scott A. HaleLLM AlignmentHuman Preference Modeling

  2. The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment

    Jun 4, 2026Jiachen Zhao, Zhengxuan Wu, Aryaman Arora +3LLM AlignmentLLM Fine-Tuning

  3. SHALA-LLM: Smartly Handling Ambiguous Labels in Aligning LLMs

    Jun 3, 2026Jingyao Wu, Ashley Wang, Keane Ong +2RL for Language ModelsLLM Alignment

  4. (Mis)generalization of Helpful-only Fine-tuning

    Jun 3, 2026Mohammad Omar Khursheed, Baram Sosis, Fabien RogerSupervised Fine-TuningLLM Sycophancy

  5. Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning

    Jun 2, 2026Ziyue Wang, Aomufei Yuan, Yongfu Zhu +10LLM AlignmentRL for Language Model Reasoning

  6. Fully Automated Identification of Lexical Alignment and Preference-Stage Shifts in Large Language Models

    Jun 2, 2026Thomas Stephan Juzek, Xiaoyang Ming, Jose A. HernandezLLM EvaluationLLM Alignment

  7. Coherence Maximization Improves Pluralistic Alignment

    Jun 2, 2026Taslim Mahbub, Yiding Pei, Shi FengLLM AlignmentHuman Preference Modeling

  8. ChatHealthAI: Aligning Electronic Health Record Representations with Large Language Models for Grounded Clinical Reasoning

    Jun 1, 2026Bo-Hong Wang, Baicheng Peng, Ruilin Wang +3LLM GroundingLLM Alignment

  9. TriAlign: Towards Universal Truth Consistency in Personalized LLM Alignment

    Jun 1, 2026Thi-Nhung Nguyen, Linhao Luo, Rollin Omari +3LLM AlignmentAlgorithmic Fairness

  10. S-SPPO: Semantic-Calibrated Self-Play Preference Optimization

    Jun 1, 2026Xiwen Chen, Wenhui Zhu, Jingjing Wang +13LLM AlignmentSelf-Play RL

  11. Truthful AI Advisors: A Pre-Specified Benchmark for Large Language Model Honesty Under Preference Misalignment

    May 31, 2026Hamidreza Hasani Balyani, Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi +2LLM EvaluationLLM Alignment

  12. Efficient Exploration for Iterative Nash Preference Optimization

    May 31, 2026Tianlong Nan, Xiaopeng Li, Christian Kroer +1Nash EquilibriumLLM Alignment

  13. ANDES: Agent Native Data Evolving Synthesis Tool for Autonomous Instruction Alignment

    May 31, 2026Zhengyang Zhao, Shengjie Ye, Lu Ma +3LLM AlignmentLLM Agent Skill Learning

  14. Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences

    May 30, 2026Cristina GarbaceaLLM AlignmentSocial Choice Theory

  15. Isolating LLM Lexical Bias: A Curation-Free Triangulated Metric for Preference-Stage Learning

    May 29, 2026Xiaoyang Ming, Jose Hernandez, Thomas Stephan JuzekLLM AlignmentLLM Fine-Tuning

  16. Preference-Aware Rubric Learning for Personalized Evaluation

    May 29, 2026Yilun Qiu, Xiaoyan Zhao, Yang Zhang +7LLM EvaluationLLM Alignment

  17. Reinforcement Learning Can Amplify Emergent Misalignment from Harmless Rewards

    May 29, 2026Magnus Jørgenvåg, David Kaczér, Lasse Ruttert +3RL for Language ModelsLLM Alignment

  18. A Persona-Based Evaluation Framework for Pluralistic Alignment in Generative AI

    May 29, 2026Atahan KaragozLLM AlignmentPersona Consistency

  19. TUX: Measuring Human--AI Tacit Understanding

    May 29, 2026Yueshen Li, Hanyi Min, Vedant Das Swain +1LLM AlignmentLLM Agent Evaluation

  20. The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement

    May 29, 2026Xiaobo Wang, Tong Wu, Min Tang +3Reward ModelingLLM Alignment

  21. Federated Variational Preference Alignment with Gumbel-Softmax Prior for Personalized User Preferences

    May 29, 2026Jabin Koo, Hoyoung Kim, Minwoo Jang +1LLM AlignmentPreference Alignment

  22. Differentially Private Preference Data Synthesis for Large Language Model Alignment

    May 29, 2026Fengyu Gao, Jing YangPairwise Preference LearningLLM Alignment

  23. EUDAIMONIA: Evaluating Undesirable Dynamics in AI

    May 28, 2026Jun Rui Huang, Wang Bill Zhu, Ziyi Liu +3LLM AlignmentLanguage Model Safety Evaluation

  24. Measuring, Localizing, and Ablating Alignment Signatures in LLMs

    May 28, 2026Aniket Anand, Janvijay Singh, Zhewei Sun +2LLM AlignmentAI-Generated Text Detection

  25. Recovering Diversity Without Losing Alignment: A DPO Recipe for Post-Trained LLMs

    May 28, 2026Vinay Samuel, Yapei Chang, Mohit IyyerLLM AlignmentDirect Preference Optimization

  26. Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization

    May 28, 2026Zhihao Liu, Yifan Wu, Jian Lou +3LLM AlignmentZeroth-Order Optimization

  27. When and How Human Curation Backfires: Preference Alignment under Multi-Model Self-Consuming Loop

    May 28, 2026Yang Zhang, Xiukun Wei, Xueru ZhangLLM AlignmentSelf-Training