LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict

    Jan 7, 2026Guanyu Chen, Chenxiao Yu, Xiyang HuLLM EvaluationLLM Alignment

  2. Metaphors are a Source of Cross-Domain Misalignment of Large Reasoning Models

    Jan 6, 2026Zhibo Hu, Chen Wang, Yanfeng Shu +2LLM AlignmentEmergent Misalignment in Language Models

  3. HAL: Inducing Human-likeness in LLMs with Alignment

    Jan 6, 2026Masum Hasan, Junjie Zhao, Ehsan HoqueReward ModelingLLM Alignment

  4. Shapley-based Data Valuation for LLM Alignment via Sequential Preference Optimization

    Dec 12, 2025Mélissa Tamine, Otmane Sakhi, Benjamin Heymann +2LLM AlignmentShapley Value Attribution

  5. Aligning LLMs with Biomedical Knowledge using Balanced Fine-Tuning

    Nov 26, 2025Zhenchao Tang, Fang Wang, Haohuai He +13LLM AlignmentLLM Fine-Tuning

  6. Value Drifts: Tracing Value Alignment During LLM Post-Training

    Oct 30, 2025Mehar Bhatia, Shravan Nayak, Gaurav Kamath +4LLM AlignmentPreference Optimization

  7. OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

    Oct 28, 2025Ziyou Hu, Zhengliang Shi, Minghang Zhu +5Reward ModelingRL for Language Models

  8. Navigating the Alignment-Calibration Trade-off: A Pareto-Superior Frontier via Model Merging

    Oct 20, 2025Tiancheng Hu, Benjamin Minixhofer, Nigel CollierLLM AlignmentModel Calibration

  9. Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate

    Oct 11, 2025Pratik S. Sachdeva, Tom van NuenenLLM AlignmentMoral Reasoning in Language Models

  10. TagPR: Tag-Guided Process Supervision for Personalization Reasoning in Large Language Models

    Sep 27, 2025Song Jin, Juntian Zhang, Ruyu Lyu +7LLM AlignmentLLM Personalization

  11. ESSA: Evolutionary Strategies for Scalable Alignment

    Jul 6, 2025Daria Korotyshova, Boris Shaposhnikov, Alexey Malakhov +7LLM AlignmentEvolutionary Optimization

  12. A Technical Survey of Reinforcement Learning Techniques for Large Language Models

    Jul 5, 2025Saksham Sahai Srivastava, Vaneet AggarwalRL for Language ModelsLLM Alignment

  13. KARE-RAG: Knowledge-Aware Refinement and Enhancement for RAG

    Jun 3, 2025Yongjian Li, HaoCheng Chu, Yukun Yan +7Retrieval-Augmented GenerationLLM Alignment

  14. InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models

    May 20, 2025Yanggan Gu, Yuanyi Wang, Zhaoyi Yan +4Language Model MergingLLM Alignment

  15. R3: Robust Rubric-Agnostic Reward Models

    May 19, 2025David Anugraha, Zilu Tang, Lester James V. Miranda +5Reward ModelingLLM Evaluation

  16. Bias Fitting to Mitigate Length Bias of Reward Model in RLHF

    May 19, 2025Kangwen Zhao, Jianfeng Cai, Jinhua Zhu +5Reward ModelingLLM Alignment

  17. Adaptive Helpfulness-Harmlessness Alignment with Preference Vectors

    Apr 27, 2025Ren-Wei Liang, Chin-Ting Hsu, Chan-Hung Yu +6LLM AlignmentLLM Safety Alignment

  18. Dual-Difficulty Curriculum Learning for Direct Preference Optimization

    Apr 10, 2025Mengyang Li, Haozhan Geng, Zhong Zhang +1Pairwise Preference LearningLLM Alignment

  19. Truthful or Fabricated? Using Causal Attribution to Mitigate Reward Hacking in Explanations

    Apr 7, 2025Pedro Ferreira, Wilker Aziz, Ivan TitovCoT FaithfulnessReward Hacking

  20. Evolutionary Guided Decoding: Iterative Value Refinement for LLMs

    Mar 4, 2025Zhenhua Liu, Lijun Li, Ruizhe Chen +5LLM AlignmentLanguage Model Decoding

  21. Societal Alignment Frameworks Can Improve LLM Alignment

    Feb 27, 2025Karolina Stańczak, Nicholas Meade, Mehar Bhatia +14LLM AlignmentAI Alignment

  22. Foundations of Large Language Models

    Jan 16, 2025Tong Xiao, Jingbo ZhuLanguage Model PretrainingLLM Alignment

  23. Decoupled Alignment for Robust Plug-and-Play Adaptation

    Jun 3, 2024Haozheng Luo, Jiahao Yu, Wenxin Zhang +9LLM AlignmentLLM Safety Alignment

  24. KTO: Model Alignment as Prospect Theoretic Optimization

    Feb 2, 2024Kawin Ethayarajh, Winnie Xu, Niklas Muennighoff +2LLM AlignmentHuman Preference Modeling

  25. Aligning Language Models with Observational Data: Opportunities and Risks from a Causal Perspective

    Date pendingErfan LoghmaniLLM AlignmentLLM Fine-Tuning

  26. Alignment Reduces Expressed but Not Encoded Gender Bias: A Unified Framework and Study

    Date pendingNour Bouchouchi, Thibault Laugel, Xavier Renard +3Gender Bias in Language ModelsLLM Alignment