LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

    May 18, 2026Yanyun Wang, Yu Huang, Zi Liang +2LLM AlignmentAudio-Language Models

  2. A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAMΔΔ Integration into Upcycled MoE

    May 18, 2026Hao Zhou, Tianhao Li, Zhijun Wang +6Multilingual Language ModelsMixture-of-Experts Language Models

  3. Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment

    May 17, 2026Yucong Huang, Xiucheng Li, Kaiqi Zhao +1Reward ModelingLLM Alignment

  4. From Sycophantic Consensus to Pluralistic Repair: Why AI Alignment Must Surface Disagreement

    May 14, 2026Varad Vishwarupe, Nigel Shadbolt, Marina JirotkaLLM SycophancyLLM Alignment

  5. DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping

    May 14, 2026Pengyun Zhu, Yuqi Ren, Zhen Wang +2LLM AlignmentPluralistic Alignment

  6. Reducing the Safety Tax in LLM Safety Alignment with On-Policy Self-Distillation

    May 14, 2026Yu Fu, Longxuan Yu, Haz Sameen Shahgir +4LLM AlignmentOn-Policy Self-Distillation

  7. Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment

    May 13, 2026Ye Wang, Jing Liu, Toshiaki Koike-AkinoReward HackingLLM Alignment

  8. Probing Persona-Dependent Preferences in Language Models

    May 13, 2026Oscar Gilg, Pierre Beckmann, Daniel Paleka +1LLM AlignmentLLM Interpretability

  9. Persona-Model Collapse in Emergent Misalignment

    May 13, 2026Davi Bastos Costa, Renato VicenteLLM AlignmentLLM Fine-Tuning

  10. Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer

    May 12, 2026Baris Askin, Muhammed Ustaomeroglu, Anupam Nayak +3Supervised Fine-TuningLLM Alignment

  11. TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching

    May 12, 2026Truong Nguyen, Tien-Phat Nguyen, Linh Ngo Van +3Pairwise Preference LearningLLM Alignment

  12. To Whom Do Language Models Align? Measuring Principal Hierarchies Under High-Stakes Competing Demands

    May 12, 2026Fangyi Yu, Nabeel Seedat, Jonathan Richard Schwarz +1LLM AlignmentLanguage Model Safety Evaluation

  13. Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance

    May 12, 2026Wenhao Chen, Sirui Sun, Shengyuan Bai +1LLM AlignmentLLM Safety Alignment

  14. StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models

    May 12, 2026Ishmam Khan, Sindhuja Thogarrati, Shuo ZhangLLM AlignmentLLM Fine-Tuning

  15. DGPO: Beyond Pairwise Preferences with Directional Consistent Groupwise Optimization

    May 11, 2026Mengyi Deng, Zhiwei Li, Xin Li +4LLM AlignmentReasoning Consistency in Language Models

  16. Training-Free Cultural Alignment of Large Language Models via Persona Disagreement

    May 11, 2026Huynh Trung Kiet, Dao Sy Duy Minh, Tuan Nguyen +5LLM AlignmentCultural Alignment

  17. Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs

    May 11, 2026Krishak Aneja, Manas Mittal, Anmol Goel +2LLM AlignmentLLM Interpretability

  18. Aligning LLM Uncertainty with Human Disagreement in Subjectivity Analysis

    May 11, 2026Junyu Lu, Deyi Ji, Xuanyi Liu +5Annotator DisagreementLLM Alignment

  19. Positive Alignment: Artificial Intelligence for Human Flourishing

    May 11, 2026Ruben Laukkonen, Seb Krier, Chloé Bakalar +13LLM AlignmentAI Alignment

  20. Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs

    May 11, 2026Wu Li, Yigeng Zhou, Zesheng Shi +3LLM AlignmentSelf-Play RL

  21. Pseudo-Deliberation in Language Models: When Reasoning Fails to Align Values and Actions

    May 11, 2026Sushrita Rakshit, Hanwen Zhang, Hua ShenLLM AlignmentLLM Auditing

  22. Personalized Alignment Revisited: The Necessity and Sufficiency of User Diversity

    May 9, 2026Enoch Hyunwook KangLLM AlignmentPersonalized Language Model Alignment