LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. Predicting Alignment Generalization with Value Representations

    Oct 8, 2026Andy Liu, Mehar Bhatia, Karolina Stanczak +3LLM AlignmentRepresentation Geometry in Language Models

  2. Conversational Voice Aesthetic Model with Reinforcement Learning from Human Listeners

    Oct 7, 2026Xilin Jiang, Shun Zhang, Tejas Jayashankar +2Speech Language ModelsLLM Alignment

  3. SafeEvo: Deciphering the Safety Alignment Mechanism and Evolution in Language Models

    Oct 7, 2026Miao Yu, Hao Huang, Lu Yuan +3LLM Safety AlignmentLLM Alignment

  4. The Persona Hierarchy Model: Understanding Contextual Generalization in Fine-Tuning LLMs

    Oct 7, 2026Jiachen Zhao, Zhengxuan Wu, David Bau +1LLM Fine-TuningLLM Alignment

  5. Reward Stealing Attack on Large Language Models

    Oct 5, 2026Jiaming Qian, Pengyang Zhou, Jiahe Xu +1LLM AlignmentModel Extraction Attacks

  6. EmoRSS: Mitigating Emotion-Induced Over-Refusal in Large Language Models

    Oct 4, 2026Shuyi Miao, Yaojin Ma, Chenhang Cui +5LLM AlignmentLLM Refusal Behavior

  7. Detecting Inconsistencies in Model Specifications with LLM-as-Verifier Reasoning

    Oct 1, 2026Zichen Xie, Mrigank Pawagi, Lize Shao +2LLM AlignmentLLM Auditing

  8. The Asymptotics of Language Model Alignment with Memory

    Oct 1, 2026Haricharan Balasundaram, V. Arvind RameshwarRL for Language ModelsLLM Alignment

  9. Beyond Linear Concepts: Discovering and Aligning Non-Linear Concept Manifolds in Large Language Models

    Oct 1, 2026Tido Specht, Elias Benedict Krey, Nils Neukirch +1LLM AlignmentLLM Interpretability

  10. GAW-PO: Preference Optimization with Gradient-Aligned Token Weights

    Oct 1, 2026Andreea Dutulescu, Stefan Ruseti, Mihai Masala +2LLM AlignmentDirect Preference Optimization

  11. Pre-training interventions, ex post facto: Grafting model beliefs across checkpoints

    Sep 30, 2026Peter Nutter, Dani Roytburg, Clément Dumas +2Fine-TuningLLM Alignment

  12. Robust Nash Alignment under Preference Uncertainty

    Sep 30, 2026Shihab Ahmed, Debamita Ghosh, David Tang +3LLM AlignmentPreference Alignment

  13. Emergent Unfaithfulness: How Alignment Training Causes Language Models to Silently Override Task Faithfulness

    Sep 30, 2026Pardis Sadat Zahraei, Janvijay Singh, Gokhan Tur +1LLM AlignmentInstruction Following

  14. Values as Style: Disentangling Values from Semantics with One-Way Mixing for Low-Damage LLM Steering

    Sep 30, 2026Jiale Dai, Hongcan Deng, Liuxian Ma +2Disentangled Representation LearningLLM Alignment

  15. Ready2Blend: From Natural-Language Instructions to Composable Alignment Prompts

    Sep 30, 2026Jeesu Jung, Hwan Chang, Juseon Do +5Continual Learning for LLMsLLM Alignment

  16. Multi-LLM Collaborative Alignment via Stackelberg Games

    Sep 30, 2026Christina Hahn, Shangbin Feng, Dean Light +3RL for Language ModelsLLM Alignment

  17. Optimal Design for Active Preference Learning with Biased LLM Judges

    Sep 30, 2026Zhongman Du, Huiming Zhang, Haodong Zhu +1Pairwise Preference LearningLLM Alignment

  18. Beyond Oracle Communication: Benchmarking Interactive Intent Alignment Under Miscommunication and Evolving User Intent

    Sep 29, 2026Zheyuan Zhang, Mengyuan Chao, Ke Xiao +5LLM AlignmentLLM Agent Evaluation

  19. Aligned Data Can Induce Misalignment via Context Confusion

    Sep 29, 2026Yavuz Bakman, Duygu Nur Yaldiz, Baris Askin +4LLM AlignmentLLM Post-Training

  20. ContextAdapt: Evaluating Contextual Adaptation and Value Alignment in LLMs

    Sep 29, 2026Olivia Macmillan-Scott, Mirco MusolesiLLM AlignmentLanguage Model Safety Evaluation

  21. FLOORA: A Human-Aligned Domain-Specific Language Model for Architectural Design

    Sep 28, 2026Sahand Rezaei-Shoshtari, Patryk Wozniczka, Shu Ishida +14LLM AlignmentLanguage Modeling

  22. From Normative Frameworks to Alignment Data: Constructing and Evaluating SFT and Preference Data

    Sep 28, 2026Husrev Taha Sencar, Rezart Beka, Danish Naeem +6LLM AlignmentPreference Alignment

  23. BA-DPO: Bias-Adjusted Direct Preference Optimization for Language Model Alignment

    Sep 28, 2026Antonio Ferrara, Alberto Rumi, Francesco BonchiLLM AlignmentDebiased ML

  24. ABC-Align: Prediction-Powered Alignment with Adaptive Bias Control

    Sep 28, 2026Eric Frankel, Banghua Zhu, Sewoong Oh +1RL for Language ModelsLLM Alignment

  25. Direct Hidden-State Alignment: Mapping and Controlling Preference Expression in LLMs

    Sep 27, 2026Fansheng Zhang, Shengran Guo, Zexiao Wang +3LLM AlignmentPreference Alignment

  26. Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures

    Sep 24, 2026Ruoqi Guo, Yi Liu, Gelei Deng +6LLM Safety BenchmarksLLM Alignment