Large Language Model Alignment

Latest papers 295

All topics
CardsList
  1. Detecting Inconsistencies in Model Specifications with LLM-as-Verifier Reasoning

    Oct 1, 2026Zichen Xie, Mrigank Pawagi, Lize Shao +2Large Language Model Alignment

  2. The Asymptotics of Language Model Alignment with Memory

    Oct 1, 2026Haricharan Balasundaram, V. Arvind RameshwarLarge Language Model AlignmentLanguage Modeling

  3. Beyond Linear Concepts: Discovering and Aligning Non-Linear Concept Manifolds in Large Language Models

    Oct 1, 2026Tido Specht, Elias Benedict Krey, Nils Neukirch +1Large Language Model AlignmentMultimodal Large Language Models

  4. HeadEdit: Calibrating Language Model Behavior Through the Frozen Unembedding Matrix

    Oct 1, 2026Zirui He, Haiyan Zhao, Jingyu Hu +5Large Language Model AlignmentTuning

  5. Emergent Unfaithfulness: How Alignment Training Causes Language Models to Silently Override Task Faithfulness

    Sep 30, 2026Pardis Sadat Zahraei, Janvijay Singh, Gokhan Tur +1Large Language Model AlignmentFaithfulness

  6. Values as Style: Disentangling Values from Semantics with One-Way Mixing for Low-Damage LLM Steering

    Sep 30, 2026Jiale Dai, Hongcan Deng, Liuxian Ma +2Large Language Model AlignmentEdit

  7. Multi-LLM Collaborative Alignment via Stackelberg Games

    Sep 30, 2026Christina Hahn, Shangbin Feng, Dean Light +3Large Language Model AlignmentStackelberg Equilibrium

  8. LEARN-TS: LLM-Enhanced Alignment and Reconstruction with Normality Guidance for Multivariate Time-Series Anomaly Detection

    Sep 30, 2026Jahyeob Koo, Kio Yun, Byoungmo Koo +1Time-Series Anomaly DetectionTime Series

  9. Aligned Data Can Induce Misalignment via Context Confusion

    Sep 29, 2026Yavuz Bakman, Duygu Nur Yaldiz, Baris Askin +4Large Language Model AlignmentTraining-Inference Mismatch

  10. ACTR: Aligning Thoughts and Responses for Multilingual Safety in Reasoning LLMs

    Sep 29, 2026Xianhui Zhang, Jian Yu, Chengyu Xie +6Multilingual SafetyLarge Language Model Safety

  11. Towards Mitigating Deceptive Safety Alignment in Large Reasoning Models

    Sep 28, 2026Xiangyu Zhou, Saleh Zare Zade, Rafi Ibn Sultan +2Safety AlignmentLarge Reasoning Models

  12. Population Fidelity: Evaluating Population Representativeness in LLMs

    Sep 28, 2026Neemias B. da Silva, Martin Lukk, Ali Sutani +5Large Language Model BiasDemographics

  13. Narrow Multimodal Fine-Tuning Can Induce Emergent Misalignment

    Sep 28, 2026Shunchang Liu, Lukas Fluri, Xin Chen +1Emergent MisalignmentModality Alignment

  14. From Normative Frameworks to Alignment Data: Constructing and Evaluating SFT and Preference Data

    Sep 28, 2026Husrev Taha Sencar, Rezart Beka, Danish Naeem +6Large Language Model AlignmentSocial Norms

  15. See it, Say it, Sorted: Mechanistic Diagnosis and Parameter-Space Mitigation of Emergent Misalignment in LLMs

    Sep 28, 2026Weiqiao Que, Ruizhe Li, Chengyu Wang +3Large Language Model SafetyEmergent Misalignment

  16. Muon Sublates the Edge of Stability in LLM Pretraining

    Sep 28, 2026Yanzhe Chen, Qifang Zhao, Xiaoxiao Xu +1MuonLarge Language Model Alignment

  17. DeShortcut-Align: Decoupling Spurious Shortcuts for Robust Safety Alignment in Large Reasoning Models

    Sep 28, 2026Qirui Liu, Yichen Sun, Yan Wang +4Safety AlignmentLarge Language Model Alignment

  18. The Alignment Illusion in Multimodal Large Language Models

    Sep 24, 2026Hong-Han Wang, Yuntao Wang, Hu DingMultimodal Large Language ModelsLarge Language Model Alignment

  19. Alignment Forecasting: Predicting Misalignment From Training Data

    Sep 19, 2026Chen Yueh-Han, Bruce W. Lee, Ilia Sucholutsky +1Large Language Model AlignmentMisalignment Persona

  20. GYROval: A Robust Benchmark for Cultural Value Orientation in Large Language Models

    Sep 16, 2026Alexander Didenko, Anna Shabanova, Vladislav Zapylikhin +2Cultural AwarenessLarge Language Model Alignment

  21. TAME: Token Attribution and Masking for Emergent misalignment

    Sep 15, 2026Md Rayhanul Masud, Md Rizwan ParvezEmergent MisalignmentLarge Language Model Alignment

  22. Toward Robust Personalized Alignment for LLMs: Mitigating Persona Drift in Multi-Turn Dialogue

    Sep 14, 2026Youyuan Zhang, Siyuan Li, Fangming Liu +1Large Language Model AlignmentPersistent State

  23. Direct Preference Density Alignment for Conversational Audio Equalization

    Sep 14, 2026Ioannis Stylianou, Sven Ewan Shepstone, Jon Francombe +2Backtranslation Augmented Direct Preference OptimizationLarge Language Model Alignment

  24. Forty Shades of Blue: Quality-Diversity Alignment via Mode-Conditioned Reinforcement Learning

    Sep 14, 2026Jiayi Yuan, Hangoo Kang, James Jihao Liu +4Large Language Model AlignmentMulti-Agent Reinforcement Learning

  25. One Example Is Enough to Pass Fairness Benchmarks: Rethinking Fairness Evaluation for Aligned LLMs

    Sep 14, 2026Naihao Deng, Samee Arif, Shuaichen Chang +2Algorithmic FairnessLarge Language Model Alignment

  26. An Efficient and Modular Framework for Targeted Harm Mitigation in LLMS

    Sep 12, 2026Roberto Campbell, Momin Abbass, Muneeza Azmat +5Large Language Model SafetyLarge Language Model Alignment

  27. Suan: Rectifying Direct Preference Safety Alignment in Large Language Models

    Sep 8, 2026Oleksandr Cherednichenko, Roman KlypaSafety AlignmentLarge Language Model Alignment

  28. Same Values, Different Languages? From Multilingual Probing to Steering LLMs Toward Chinese Social Values

    Sep 8, 2026Yuemei Xu, Kexin Xu, Jian Zhou +3Human ValuesLanguage Pairs

  29. From Echo Chambers to Epistemic Monoculture: Large Language Models Present Temporally Contingent Partisan Alignments as Knowledge

    Sep 7, 2026Wend K. TamPolitical DiscourseLarge Language Model Alignment

  30. We're Cooked! - Probing LLM Political Alignment Via Conflict-Framed Recipe Translation

    Sep 7, 2026Svetlana Gorovaia, Angelica Henestrosa, Ivan P. YamshchikovLarge Language Model AlignmentIdeology

  31. Representational alignment yields generalizable safety in language models

    Sep 3, 2026Lingyu Li, Yan Teng, Yingchun Wang +1Large Language Model SafetyLarge Language Model Alignment

  32. Beyond Shallow Alignment: How Post-Training Methods Determine Refusal Circuits And Steering Robustness

    Sep 3, 2026Hoang Cuong Nguyen, Mark Dras, Usman NaseemRefusalsLarge Language Model Alignment

  33. SafeRI: Recognition and Intervention for Token-Level Safety Intervention in Large Vision Language Models

    Sep 3, 2026Caoyuan Ma, Tian Gu, Wenpu Liu +11Safety AlignmentLarge Language Model Alignment

  34. Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards

    Sep 3, 2026Leqi Zheng, Jinbo Su, Fang Niu +8Reinforcement Learning With Verifiable RewardLLM Reasoning Strategies

  35. Less Is Moral: A CHARMing Framework for Moral Foundations Detection in Endorsement Behaviour

    Sep 3, 2026Huixiang Fu, Marian-Andrei RizoiuMoral ReasoningHate Speech Detection

  36. No country for old linguists: LLM-brain alignment underdetermines neural computation

    Sep 2, 2026Elliot MurphyLarge Language Model AlignmentArtificial Intelligence Alignment

  37. Aligned but Flattened: Analyzing the Trade-off between Cultural Alignment and Diversity in LLMs

    Sep 1, 2026Jingshen Zhang, Shaoyang Xu, Wenxuan ZhangLarge Language Model AlignmentCultural Awareness

  38. Balancing Privacy, Utility, and Safety in LLM Alignment through Preference Optimization

    Aug 31, 2026Dishu Yang, Jingjing Liu, Jize LiPrivacyLarge Language Model Alignment

  39. Pak3H: Evaluating the Cost of Cultural Mismatch in LLM Alignment with a Human-Contextualized Urdu Benchmark

    Aug 30, 2026Abdullah Hashmat, Usman Naseem, Agha Ali RazaUrduLarge Language Model Alignment

  40. Evolutionary Soups: Evolving Mixture-of-Experts for Multi-Objective LLM Alignment

    Aug 30, 2026Lingxiao Kong, Steffen Staab, Cong Yang +2Large Language Model AlignmentMulti-Objective Optimization

  41. When Safety Speaks a Language: A Mechanistic Analysis of Safety-Language Identity Entanglement in LLMs

    Aug 30, 2026Apoorva Upadhyaya, Sandipan SikdarMultilingual SafetyLarge Language Model Safety

  42. How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

    Aug 12, 2026Guang Yang, Fengchen Liu, Alex Wang +2Large Language Model AlignmentRefusals

  43. Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

    Aug 12, 2026Mingyu Zong, Sampad Mohanty, Bhaskar KrishnamachariSafety AlignmentLarge Language Model Alignment

  44. Data Attribution of Emergent Misalignment with Persona Features

    Aug 11, 2026Clemens Vetter, David Kaczér, Lucie Flek +1Emergent MisalignmentLarge Language Model Alignment

  45. Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes

    Aug 10, 2026Alec Harris, Kasey Corra, Archie Chaudhury +1Large Language Model EvaluationLarge Language Model Alignment

  46. People Are Not Just Their Countries. Disentangling Social Determinants of LLM Value Alignment Across Europe

    Aug 7, 2026Maria-Louisa Wightman, Guillaume Bied, Tijl De BieHuman ValuesLarge Language Model Alignment

  47. Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment

    Aug 5, 2026Alina Klerings, Jannik Brinkmann, Heiner Stuckenschmidt +1Safety AlignmentLarge Language Model Alignment

  48. Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

    Aug 3, 2026Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel +1Large Language Model SafetyLarge Language Model Alignment

  49. Human-LLM Alignment in Language Attitudes Toward Non-Native Japanese

    Aug 3, 2026Naho Orita, Hayato Ogawa, Daisuke KawaharaLarge Language Model BiasLanguage Pairs

  50. Semantic Alignment of AI Models: Concept Collapse, Checkpoint Dynamics, and Cross-Lingual Transfer

    Aug 3, 2026Tyler Ashoff, Jordan RoduLarge Language Model AlignmentCross-Lingual Transfer