LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. Multi-Adapter Representation Interventions via Energy Calibration

    May 27, 2026Manjiang Yu, Hongji Li, Junwei Chen +4LLM AlignmentLLM Safety Alignment

  2. The Attentional White Bear Effect in Transformer Language Models

    May 27, 2026Rebecca Ramnauth, Brian ScassellatiTransformer InterpretabilityLLM Alignment

  3. AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates

    May 27, 2026Shaolong Chen, Madalina Ciobanu, Qingqing Mao +1LLM AlignmentDirect Preference Optimization

  4. Behavioural Analysis of Alignment Faking

    May 26, 2026Nathaniel Mitrani Hadida, Rhea Karty, David Williams-King +1LLM AlignmentValue Alignment

  5. Attribute-Based Diagnosis of LLM Alignment with Hate Speech Annotations

    May 26, 2026Mohammad Amine Jradi, Faeze Ghorbanpour, Alexander FraserLLM EvaluationLLM Alignment

  6. Multi-Stakeholder LLM Alignment: Decomposing Estimation from Aggregation

    May 26, 2026Lulu Zheng, Wenjin Yang, Xiangwen Zhang +4LLM AlignmentLLM-as-a-Judge

  7. KARMA: Karma-Aligned Reward Model Adaptation

    May 26, 2026Jared Scott, Jesse RobertsReward ModelingRL for Language Models

  8. Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories

    May 26, 2026Sil Hamilton, David MimnoLLM AlignmentDiverse Text Generation

  9. Curriculum Learning for Safety Alignment

    May 25, 2026Sandeep Kumar, Virginia Smith, Chhavi YadavLLM AlignmentDirect Preference Optimization

  10. CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations

    May 25, 2026Mike Zhang, Ali Basirat, Desmond ElliottMultilingual Language ModelsLLM Alignment

  11. MATO: Multi-objective Personalized Alignment with Test-time Optimization for Large Language Models

    May 25, 2026Linhao Luo, Thuy-Trang Vu, Van-Anh Nguyen +3LLM AlignmentInference-Time Optimization

  12. Whose Alignment? Comparing LLM Process Alignment Across Diverse Organizational Decision Contexts

    May 24, 2026Niklas Weller, Emilio BarkettAI-Assisted Decision MakingLLM Alignment

  13. Investigating the Interplay between Contextual and Parametric Chain-of-Thought Faithfulness under Optimization

    May 24, 2026Jingyi Sun, Qianli Wang, Pepa Atanasova +2CoT FaithfulnessContextual Faithfulness

  14. Emotional intelligence in large language models is fragmented across perception, cognition, and interaction

    May 23, 2026Minghao Lv, Lu Chen, Enchang Zhang +6LLM EvaluationLLM Alignment

  15. Convex Optimization for Alignment and Preference Learning on a Single GPU

    May 22, 2026Miria Feng, Mert PilanciPairwise Preference LearningLLM Alignment

  16. Can AI Make Conflicts Worse? An Alignment Failure in LLM Deployment Across Conflict Contexts

    May 21, 2026Andrii KryshtalLLM AlignmentLanguage Model Safety Evaluation

  17. Token-weighted Direct Preference Optimization with Attention

    May 21, 2026Chengyu Huang, Zhuohang Li, Sheng-Yen Chou +1Pairwise Preference LearningLLM Alignment

  18. Hypergraph as Language

    May 21, 2026Mengqi Lei, Guohuan Xie, Shihui Ying +4LLM AlignmentHypergraph Learning

  19. From Parameters to Data: A Task-Parameter-Guided Fine-Tuning Pipeline for Efficient LLM Alignment

    May 20, 2026Hao Chen, Qi Zhang, Liyao Li +7LLM AlignmentLLM Fine-Tuning

  20. Towards Context-Invariant Safety Alignment for Large Language Models

    May 20, 2026Yixu Wang, Yang Yao, Xin Wang +4RL for Language ModelsLLM Alignment

  21. Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment

    May 20, 2026Zhiqin Yang, Yonggang Zhang, Wei Xue +3LLM AlignmentDirect Preference Optimization

  22. Refining and Reusing Annotation Guidelines for LLM Annotation

    May 20, 2026Kon Woo Kim, Jin-Dong Kim, Akiko AizawaLLM AlignmentLLM-Assisted Annotation

  23. Alignment Dynamics in LLM Fine-Tuning

    May 18, 2026Yuhan Huang, Huanran Chen, Yinpeng DongLLM AlignmentLLM Fine-Tuning

  24. Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation

    May 18, 2026Guining Cao, Jiaxin Peng, Chu Zeng +3Pairwise Preference LearningOpen-Ended Generation