LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. Asymmetric Communication: Large Language Models and Language Games

    Jul 30, 2026Enzo FenoglioLLM AlignmentHuman-AI Interaction

  2. OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment

    Jul 29, 2026Seonglae Cho, Adriano KoshiyamaLLM AlignmentLanguage Model Bias Evaluation

  3. DIRECT: Direct Decoding for Efficient and Aligned Sequence Labeling with Large Language Models

    Jul 29, 2026Yilei Wang, Jiaxin Gan, Kexuan Zhang +3LLM AlignmentLLM Information Extraction

  4. Constitutional Midtraining: Content Presence Drives Alignment Gains

    Jul 29, 2026Desiree Cho, Cameron Tice, Bernie Hogan +4LLM AlignmentLLM Safety Alignment

  5. MemSFT: Mitigating Alignment Tax with an External Parametric Memory

    Jul 28, 2026Jiarui Wang, Xiang Shi, Jiaqi Cao +8LLM AlignmentMemory-Augmented Language Models

  6. Decision-Level Hijacking: Injecting Cognitive Bias into Large Language Models via Bit-Flip Attacks

    Jul 28, 2026Yu Yan, Jiahao Chen, Siqi Lu +6LLM AlignmentAdversarial Attacks on LLMs

  7. Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

    Jul 27, 2026Md Rezwanul Haque, Md. Milon Islam, Fakhri KarrayRL for Language ModelsLLM Alignment

  8. Inverse RL Helps Align AI by Imitating Humans

    Jul 27, 2026Michał Wiliński, Liu Leqi, Chirag NagpalRL for Language ModelsLLM Alignment

  9. DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

    Jul 27, 2026Hao Yang, Jin Wang, Xuejie ZhangLLM AlignmentMultimodal Large Language Models

  10. Auditing Alignment Controllability in LLMs via Political Axes

    Jul 26, 2026Bartol Bućan, Nikola Sočec, Sarah Isufi +5LLM AlignmentLanguage Model Steering

  11. Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining

    Jul 25, 2026Rares A. C. Diaconescu, Iulia Slanina, Alina Florea +5LLM AlignmentLLM Safety Alignment

  12. LARA: Lightweight Adapters in the Residual Stream for Composable Adaptation and Alignment

    Jul 25, 2026Pascal Ekin, Hyosun Choi, Wei JieLLM AlignmentLow-Rank Adaptation

  13. Beyond Direct Answering: Aligning Educational LLMs as Socratic Guides via Heuristic Reinforcement Learning

    Jul 25, 2026Xiaokun Wang, Siyu Song, Wentao Liu +1LLM AlignmentIntelligent Tutoring Systems

  14. A Roadmap to Impactful Pluralistic Alignment Research

    Jul 24, 2026Elinor Poole-Dayan, Jillian Fisher, Atoosa Kasirzadeh +3LLM AlignmentPluralistic Alignment

  15. A Unified Moral-Value Dataset for Instruction Tuning

    Jul 23, 2026Zhaohui Zeng, Florian MaiLLM AlignmentMoral Reasoning in Language Models

  16. LKValues: Aligning Large Language Models with Sri Lankan Societal Values

    Jul 22, 2026Nethmi Muthugala, Supryadi, Surangika Ranathunga +7Multilingual Language Model EvaluationLLM Alignment

  17. Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups

    Jul 22, 2026Haran Shani-Narkiss, Michael Fire, Oren TsurLLM EvaluationLLM Alignment

  18. D2VBench: Benchmarking Large Language Models with Value Dilemmas in Daily Scenarios

    Jul 22, 2026Siyi Hao, Yidi Cao, Linhao Yu +2LLM EvaluationLLM Alignment

  19. Measuring Reward-Seeking via Contrastive Belief Updates

    Jul 21, 2026Axel Højmark, Jérémy Scheurer, Evgenia Nitishinskaya +5RL for Language ModelsLLM Alignment

  20. Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs

    Jul 21, 2026Seunghyun Lee, Dongyoon Han, Sangdoo YunLLM AlignmentLLM Refusal

  21. How Does Alignment Tuning Shape Representations of Sycophancy and Related Cue-Induced Biases in LLMs?

    Jul 20, 2026Prakhar Gupta, Terry Jingchen Zhang, Florent Draye +2LLM SycophancyLLM Alignment

  22. Pancasila-Dilemmas: Evaluating Large Language Models on Indonesian Human Value Dilemmas Grounded in Pancasila

    Jul 20, 2026Supryadi, Irfan, Julianti +4LLM EvaluationLLM Alignment

  23. A Geometric Perspective on Stabilizing Value Conflict Resolution

    Jul 20, 2026Saket Reddy, Andy LiuLLM AlignmentMoral Reasoning in Language Models

  24. Toward Anthropomorphic Dialogue: A Closed-Loop Framework for Human-Like Chat Generation, Evaluation, and Preference Alignment

    Jul 19, 2026Wentao Liu, Siyu Song, Xi Chen +4LLM AlignmentLarge Language Model-Based Role-Play Simulation