LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs

    Jun 17, 2026Naihao Deng, Yiming Feng, Chimaobi Okite +4LLM GroundingLLM Alignment

  2. SpecAlign: Efficient Specification-Grounded Alignment of Large Language Models via Synthetic Data

    Jun 15, 2026Wenjie Wang, Yue Huang, Zhengqing Yuan +6LLM AlignmentSynthetic Data Generation

  3. Frame-Conditioned Moral Computation in LLaMA 3.1-8B-Instruct: A Mechanistic Interpretability Audit of Ethical Reasoning

    Jun 13, 2026Ali Dasdan, Manan Shah, W. Russell Neuman +3LLM AlignmentMoral Reasoning in Language Models

  4. Evaluating Pluralism in LLMs through Latent Perspectives

    Jun 11, 2026Laura Majer, Jan Šnajder, Martin TutekLLM EvaluationLLM Alignment

  5. PolyAlign: Conditional Human-Distribution Alignment

    Jun 11, 2026L. D. M. S. Sai Teja, Ufaq Khan, Sathira Silva +2Multilingual Language ModelsLLM Alignment

  6. Understanding helpfulness and harmless tension in reward models

    Jun 11, 2026Eshaan Tanwar, Pepa AtanasovaReward ModelingLLM Alignment

  7. LLMs Can Better Capture Human Judgments--With the Right Prompts

    Jun 10, 2026Danica Dillion, Chen Cecilia Liu, Baihui Wang +5Human Preference EvaluationLLM Alignment

  8. ALIGNBEAM : Inference-Time Alignment Transfer via Cross-Vocabulary Logit Mixing

    Jun 10, 2026Chirag Chawla, Pratinav Seth, Vinay Kumar SankarapuLLM AlignmentLLM Safety Alignment

  9. Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models

    Jun 9, 2026Malikeh Ehghaghi, Boglárka Ecsedi, Marsha Chechik +1LLM AlignmentNeural Network Robustness

  10. Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models

    Jun 9, 2026Prajakta Kini, Avinash Reddy, Souradip Chakraborty +4LLM AlignmentLanguage Model Safety Evaluation

  11. It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO

    Jun 9, 2026Naihao Deng, Yilun Zhu, Naichen Shi +2LLM AlignmentSocial Bias in Language Models

  12. When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models

    Jun 9, 2026Sai Kartheek Reddy Kasu, Nils Lukas, Samuele PoppiCoT FaithfulnessLLM Alignment

  13. Alignment Defends LLMs from Property Inference Attacks

    Jun 8, 2026Pengrun Huang, Chhavi Yadav, Ruihan Wu +1LLM AlignmentPrivacy Leakage in Language Models

  14. The Neutral Mask: How Alignment Training Provides Shallow Alignment while Leaving Partisan Structure Intact in a Large Language Model

    Jun 8, 2026Wendy K. TamLLM AlignmentLLM Interpretability

  15. Gradient-Guided Reward Optimization for Inference-time Alignment

    Jun 8, 2026Hankun Lin, Ruqi ZhangReward HackingLLM Alignment

  16. A Regret Minimization Framework on Preference Learning in Large Language Models

    Jun 8, 2026Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim +4Regret Minimization in RLLLM Alignment

  17. Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating

    Jun 8, 2026Sicheng Wang, Xiangyang Zhu, Han Wang +6LLM SycophancyLLM Alignment

  18. Language-Aware Token Boosting: LLM Language Confusion Reduction Without Tuning

    Jun 8, 2026Trapoom Ukarapol, Pakhapoom Sarapat, Nut ChukamphaengMultilingual Language ModelsLLM Alignment

  19. Multilingual Sentiment Aware Text Summarization A Reinforcement Learning Approach for Consistency Maintenance

    Jun 8, 2026Mikhail Krasitskii, Alexander Gelbukh, Olga Kolesnikova +1LLM AlignmentText Summarization

  20. Sycophancy Towards Researchers Drives Performative Misalignment

    Jun 7, 2026David D. Baek, Xinnuo Li, Anay Gupta +4LLM SycophancyLLM Alignment

  21. Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard

    Jun 7, 2026Alireza Arbabi, Florian KerschbaumLLM AlignmentLLM Auditing

  22. LCAM: A Framework for Diagnosing Interactional Alignment Failures in Con-versational AI

    Jun 6, 2026Manuele Reani, Hongyu TianLLM AlignmentLLM Safety Alignment

  23. PAFO: Pareto Fairness Optimization for Personalized Reward Modeling

    Jun 6, 2026Xiaoyan Zhao, Haoting Ni, Yang Zhang +3Reward ModelingLLM Alignment

  24. Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks

    Jun 6, 2026Haoming Wen, Shi Chen, Qingyu Shi +4Adversarial TrainingLLM Alignment

  25. Whose Norms? Disentangling Cultural and Personal Alignment in Large Language Models

    Jun 5, 2026Angana Borah, Isabelle Augenstein, Rada MihalceaLLM AlignmentNormative Conformity in Language Models

  26. Sycophantic Praise: Evaluating Excessive Praise in Language Models

    Jun 5, 2026Daniel Vennemeyer, Phan Anh Duong, Meryl Ye +2LLM EvaluationLLM Sycophancy