LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. CoAct: Co-Active LLM Preference Learning with Human-AI Synergy

    Apr 19, 2026Ruiyao Xu, Mihir Parmar, Tiankai Yang +3RL for Language ModelsLLM Alignment

  2. Jupiter-N Technical Report

    Apr 19, 2026George DraysonLLM AlignmentCultural Alignment

  3. Cat-DPO: Category-Adaptive Safety Alignment

    Apr 19, 2026Tiankai Yang, Yi Nian, Xinyuan Li +3LLM AlignmentDirect Preference Optimization

  4. TinyJudge: Unverifiable Constraint Alignment via Lightweight Specialist Ensembles

    Apr 19, 2026Yirong Zeng, Yufei Liu, Xiao Ding +9Reward ModelingLLM Alignment

  5. Demystifying the unreasonable effectiveness of online alignment methods

    Apr 19, 2026Enoch Hyunwook KangLLM AlignmentDirect Preference Optimization

  6. Modeling Multi-Dimensional Cognitive States in Large Language Models under Cognitive Crowding

    Apr 19, 2026Lin Zhong, Siyu Zhu, Zizhen Yuan +5LLM AlignmentCognitive Modeling

  7. Alignment Imprint: Zero-Shot AI-Generated Text Detection via Provable Preference Discrepancy

    Apr 18, 2026Junxi Wu, Kailin Huang, Dongjian Hu +4LLM AlignmentAI-Generated Text Detection

  8. On the Rejection Criterion for Proxy-based Test-time Alignment

    Apr 17, 2026Ayoub Hammal, Pierre Zweigenbaum, Caio CorroLLM AlignmentInference-Time Language Model Alignment

  9. A Systematic Study of Training-Free Methods for Trustworthy Large Language Models

    Apr 17, 2026Wai Man Si, Mingjie Li, Michael Backes +1LLM AlignmentLLM Safety

  10. GroupDPO: Memory-Efficient Group-Wise Direct Preference Optimization

    Apr 17, 2026Jixuan Leng, Si Si, Hsiang-Fu Yu +2LLM AlignmentDirect Preference Optimization

  11. Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

    Apr 10, 2026Hadas Orgad, Boyi Wei, Kaden Zheng +4LLM AlignmentEmergent Misalignment in Language Models

  12. Unbiased Reward Modeling from Implicit Feedback for LLM Alignment

    Mar 24, 2026Hao Wang, Haocheng Yang, Licheng Pan +7Reward ModelingLLM Alignment

  13. Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models

    Mar 21, 2026Xinyue Liu, Niloofar Mireshghallah, Jane C. Ginsburg +1LLM AlignmentMemorization in Language Models

  14. PA3: Policy-Aware Agent Alignment through Chain-of-Thought

    Mar 15, 2026Shubhashis Roy Dipta, Daniel Bis, Kun Zhou +4LLM AlignmentRL for Language Model Reasoning

  15. Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design

    Mar 4, 2026Yuxuan Yang, Xiaotong Mao, Jingyao WangLLM AlignmentIndoor Scene Generation

  16. Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment

    Feb 17, 2026Jialu Wang, Heinrich Peters, Asad A. Butt +6LLM AlignmentGroup Relative Policy Optimization

  17. Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges

    Feb 14, 2026Ruomeng Ding, Yifei Pang, He Sun +3LLM AlignmentLLM-as-a-Judge

  18. Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning

    Feb 14, 2026Yanbo Wang, Minzheng Wang, Jian Liang +3LLM AlignmentRL for Language Model Reasoning

  19. Evaluating Alignment of Behavioral Dispositions in LLMs

    Feb 11, 2026Amir Taubenfeld, Zorik Gekhman, Lior Nezry +8Human Preference EvaluationLLM Alignment

  20. Routing-Aware Safety Alignment for Mixture-of-Experts Models

    Feb 4, 2026Jiacheng Liang, Yuhui Wang, Tanqiu Jiang +1Mixture-of-Experts Language ModelsLLM Alignment

  21. Continuous-Utility Direct Preference Optimization

    Jan 31, 2026Muhammad Ahmed Mohsin, Muhammad Umer, Emily FoxLLM AlignmentDirect Preference Optimization

  22. VISPA: Pluralistic Alignment via Automatic Value Selection and Activation

    Jan 19, 2026Shenyan Zheng, Jiayou Zhong, Anudeex Shetty +3LLM AlignmentMulti-Objective Language Model Alignment

  23. Untangling Input Language from Reasoning Language: A Diagnostic Framework for Cross-Lingual Moral Alignment in LLMs

    Jan 15, 2026Nan Li, Bo Kang, Tijl De BieMultilingual Language Model EvaluationLLM Alignment

  24. Safety Is Not Universal: The Selective Safety Trap in LLM Alignment

    Jan 7, 2026Iago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis +2LLM Safety BenchmarksLLM Alignment