LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. Balancing Privacy, Utility, and Safety in LLM Alignment through Preference Optimization

    Aug 31, 2026Dishu Yang, Jingjing Liu, Jize LiLLM AlignmentMemorization in Language Models

  2. Pak3H: Evaluating the Cost of Cultural Mismatch in LLM Alignment with a Human-Contextualized Urdu Benchmark

    Aug 30, 2026Abdullah Hashmat, Usman Naseem, Agha Ali RazaMultilingual Language Model EvaluationLLM Alignment

  3. AI Alignment through a Game-theoretic Lens: A Survey

    Aug 28, 2026Yanan Cai, Zhongrui Zhao, Zhigang Lu +6LLM AlignmentAI Alignment

  4. A Survey on Rubric-Guided Reinforcement Learning for Language Models

    Aug 27, 2026Zifei Shan, Fangning ShaoRL for Language ModelsLLM Alignment

  5. Synthetic Persona Pretraining: Alignment from Token Zero

    Aug 13, 2026Julian Minder, Viktor Moskvoretskii, Raghav Singhal +12Synthetic Data PretrainingLLM Alignment

  6. Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

    Aug 13, 2026Xinming Wang, Weinong Wang, Hongming Yang +13RL for Language ModelsLLM Alignment

  7. Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

    Aug 12, 2026Mingyu Zong, Sampad Mohanty, Bhaskar KrishnamachariLLM AlignmentLLM Interpretability

  8. Group Alignment-Induced Sycophancy: A Two-Sided Evaluation of Steerable Pluralistic Alignment

    Aug 12, 2026Haokai Zhao, Yunze Xiao, Weihao Xuan +3LLM SycophancyLLM Alignment

  9. From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evaluation

    Aug 11, 2026Alireza S. Ziabari, Kat Ellis, Colleen Chan +1LLM AlignmentRecommender Systems

  10. Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models

    Aug 11, 2026Alexandrine Fortier, Hazel Chen, Peter WestLanguage Model PretrainingLLM Alignment

  11. Data Attribution of Emergent Misalignment with Persona Features

    Aug 11, 2026Clemens Vetter, David Kaczér, Lucie Flek +1LLM AlignmentEmergent Misalignment in Language Models

  12. Toward a Theory of Value in AI Alignment

    Aug 10, 2026Andrew Smart, Shazeda Ahmed, Jackie Kay +3LLM AlignmentAI Alignment

  13. Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes

    Aug 10, 2026Alec Harris, Kasey Corra, Archie Chaudhury +1RL for Language ModelsLLM Alignment

  14. Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization

    Aug 10, 2026Wenxiao Zhao, Shu Wang, Ying Nian WuLLM AlignmentDirect Preference Optimization

  15. Harmful Content Is Not Enough: Continuation Framing Moderates In-Context Emergent Misalignment

    Aug 8, 2026Peiyang Liu, Xi Wang, Ziqiang Cui +2LLM AlignmentEmergent Misalignment in Language Models

  16. Contextual Value Alignment via Multilayer Combinatorial Fusion

    Aug 7, 2026Yuanhong Wu, Djallel Bouneffouf, D. Frank HsuLLM AlignmentMoral Reasoning in Language Models

  17. People Are Not Just Their Countries. Disentangling Social Determinants of LLM Value Alignment Across Europe

    Aug 7, 2026Maria-Louisa Wightman, Guillaume Bied, Tijl De BieLLM AlignmentComputational Social Science

  18. SAGA: Score-Weighted Adaptive Generation Alignment for Low-Resource Nordic Language Models

    Aug 6, 2026Hoda Fakharzadehjahromy, Emil Wiman, Andreas Bueff +2LLM AlignmentDirect Preference Optimization

  19. CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits

    Aug 6, 2026Mehrshad Saadatinia, Parsa Razmara, Ardalan Aryashad +2LLM AlignmentLanguage Model Steering

  20. Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index

    Aug 5, 2026Benjamin Barlog, Hudson Craig, Zedong PengLLM EvaluationLLM Alignment

  21. Rethinking Personalized Reward Modeling for LLMs under Preference Heterogeneity via Group-Debiased Federated Learning

    Aug 3, 2026Seongyoon Kim, Boryeong Cho, Jihwan Oh +2Pairwise Preference LearningReward Modeling

  22. PALMs: Using Multi Construct-Grounded Rationales for Modeling Population Preferences in LLMs

    Aug 2, 2026Priyanka Dey, Brihi Joshi, Preyashi Poddar +2LLM AlignmentHuman Preference Modeling

  23. No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks

    Aug 2, 2026Simiao Xie, Chuancheng Shi, Shangze Li +5LLM AlignmentAdversarial Attacks on LLMs

  24. MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models

    Aug 2, 2026Ofir Ben Shoham, Oriel Perets, Nir Grinberg +1LLM AlignmentClinical Decision Support

  25. Learning Latent Reasoning Traces for Scalar Reward Models End-to-End

    Jul 31, 2026Sanwoo Lee, Clive Bai, Hsiu-Yuan Huang +3Reward ModelingLLM Alignment

  26. Inducing language models to assert their own consciousness restores human beliefs and values

    Jul 30, 2026Junsol Kim, Winnie Street, Roberta Rocca +4LLM Alignment

  27. HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks

    Jul 30, 2026Tiangang Li, Xiangbo TianRL for Language ModelsLLM Alignment