LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off

    May 9, 2026Yu Chen, Yuanhao Liu, Qi CaoLLM AlignmentLanguage Model Steering

  2. Alignment as Jurisprudence

    May 8, 2026Nicholas CaputoLLM AlignmentLegal Reasoning

  3. How Value Induction Reshapes LLM Behaviour

    May 8, 2026Arnav Arora, Natalie Schluter, Katherine Metcalf +1LLM SycophancyLLM Alignment

  4. Post-training makes large language models less human-like

    May 8, 2026Marcel Binz, Elif Akata, Abdullah Almaatouq +76LLM EvaluationLLM Alignment

  5. Rubric-based On-policy Distillation

    May 8, 2026Junfeng Fang, Zhepei Hong, Mao Zheng +7LLM AlignmentLanguage Model Distillation

  6. Confidence-Aware Alignment Makes Reasoning LLMs More Reliable

    May 8, 2026Kejia Chen, Jiawen Zhang, Yihong Wu +5LLM AlignmentDirect Preference Optimization

  7. Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference Optimization

    May 8, 2026Yurui Pan, Ke Xu, Bo PengLLM AlignmentDirect Preference Optimization

  8. Goal-Conditioned Supervised Learning for LLM Fine-Tuning

    May 8, 2026Shijun Li, Kaiwen Dong, Xiang Gao +1Supervised Fine-TuningLLM Alignment

  9. Theoretical Limits of Language Model Alignment

    May 8, 2026Lucas Monteiro Paes, Natalie Mackraz, Barry-John Theobald +1Reward HackingLLM Alignment

  10. Response Time Enhances Alignment with Heterogeneous Preferences

    May 7, 2026Federico Echenique, Alireza Fallah, Baihe Huang +1Pairwise Preference LearningLLM Alignment

  11. How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment

    May 7, 2026Rui Zhu, Weiheng Bai, Qiushi Wu +3LLM AlignmentKV-Cache Compression

  12. Strat-LLM: Stratified Strategy Alignment for LLM-based Stock Trading with Real-time Multi-Source Signals

    May 7, 2026Wenliang Huang, Zengyi YuLLM EvaluationLLM Alignment

  13. Evaluation Awareness in Language Models Has Limited Effect on Behaviour

    May 7, 2026Amelie Knecht, Lucas Florin, Thilo HagendorffLLM AlignmentLanguage Model Safety Evaluation

  14. Information Theoretic Adversarial Training of Large Language Models

    May 6, 2026Yiwei Zhang, Jeremiah Birrell, Reza Ebrahimi +3Adversarial TrainingLLM Alignment

  15. When Helpfulness Becomes Sycophancy: Sycophancy is a Boundary Failure Between Social Alignment and Epistemic Integrity in Large Language Models

    May 6, 2026Jiechen Li, Catherine A. Barry, Rishika Randev +3LLM SycophancyLLM Alignment

  16. Why Expert Alignment Is Hard: Evidence from Subjective Evaluation

    May 6, 2026Tzu-Mi Lin, Wataru Hirota, Tatsuya Ishigaki +2Human Preference EvaluationLLM Alignment

  17. Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models

    May 6, 2026Huatian Zhang, Zhendong Mao, Lei Zhang +1LLM AlignmentDirect Preference Optimization

  18. Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone

    May 6, 2026Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka +1LLM EvaluationLLM Alignment

  19. Efficiently Aligning Language Models with Online Natural Language Feedback

    May 5, 2026Christine Ye, Joe BentonReward ModelingRL for Language Models

  20. Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models

    May 5, 2026Chenchen Yuan, Zheyu Zhang, Gjergji KasneciLLM AlignmentMoral Reasoning in Language Models

  21. Mitigating Misalignment Contagion by Steering with Implicit Traits

    May 4, 2026Maria Chang, Ronny Luss, Miao Liu +3LLM AlignmentLanguage Model Steering

  22. Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models

    May 4, 2026Inoussa Mouiche, Abderaouf BahiLLM AlignmentDirect Preference Optimization

  23. Generalized Distributional Alignment Games for Unbiased Answer-Level Fine-Tuning

    May 4, 2026Mehryar Mohri, Jon Schneider, Yutao ZhongFine-TuningLLM Alignment

  24. Model Spec Midtraining: Improving How Alignment Training Generalizes

    May 3, 2026Chloe Li, Nevan Wichers, Sara Price +2LLM AlignmentLLM Safety Alignment

  25. Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment

    May 3, 2026Jiajia Li, Xiaoyu Wen, Zhongtian Ma +3LLM AlignmentLLM Safety Alignment