LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. A Method for Learning Value Systems in Generative AI

    Jul 18, 2026Andrés Holgado-Sánchez, Holger Billhardt, Sascha OssowskiReward ModelingLLM Alignment

  2. Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values

    Jul 15, 2026Jan Betley, Johannes Treutlein, Jan Dubiński +5LLM AlignmentLanguage Model Bias Evaluation

  3. ToolAlignBench: Investigating Alignment Conflicts in Tool-Calling Enabled LLMs

    Jul 15, 2026Aryan Keluskar, Amrita Bhattacharjee, Huan LiuLLM AlignmentAI Agent Safety Benchmarks

  4. Exploring Post-Training Alignment of Small Language Models for Biomedical Data-to-Text Generation: A Case Study of Medication Leaflet

    Jul 15, 2026Xi Yang, Guodong Liu, Chuqin Li +10LLM AlignmentSmall Language Models

  5. Meta-Learning Preferences for Multilingual LLM Alignment

    Jul 14, 2026Jiaying Lin, Seongho Son, Nam Phuong Tran +3RL for Language ModelsLLM Alignment

  6. Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs

    Jul 14, 2026Sen Yang, Yuen-Hei YeungLLM AlignmentCausal Interventions in Language Models

  7. Optimization Is Not All You Need

    Jul 13, 2026Minh Hua, Rita RaleyLLM AlignmentAI Governance

  8. Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health

    Jul 12, 2026Asher Sprigler, Yang-Yang Feng, Iftach Amir +5LLM AlignmentMoral Reasoning in Language Models

  9. PLURAL: A Global Dataset for Value Alignment

    Jul 9, 2026Dhruv Agarwal, Anya Shukla, Tanya Goyal +1LLM AlignmentCultural Alignment

  10. DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

    Jul 8, 2026Jordan Painter, Dipankar Srirag, Adarsh Kappiyath +3Language Model PretrainingLLM Alignment

  11. Alignment Plausibility: A New Standard for Assuring AI in Healthcare

    Jul 8, 2026Gwydion Williams, Sara Zannone, Bilal A MateenLLM AlignmentHealthcare

  12. Online Data Selection Is Implicit Alignment

    Jul 8, 2026Aoxiong Zeng, Yuxin Yang, Xiangquan YangSupervised Fine-TuningLLM Alignment

  13. Aligning Language Models with Selective Prediction

    Jul 3, 2026Gaoxiang Luo, Yifan Wu, Sinian Zhang +2RL for Language ModelsLLM Alignment

  14. Best-of-Better-NN: Generating Pre-Aligned Responses with In-Context Learning

    Jul 3, 2026Eric Lei, Hsiang Hsu, Chun-Fu ChenLLM AlignmentBest-of-N Sampling

  15. Unbiased Alignment for Large Language Models with Noisy Preferences

    Jul 3, 2026Jialiang Wang, Xianming Liu, Xiong Zhou +2Pairwise Preference LearningLLM Alignment

  16. Safe Inference-Time Alignment via Lagrangian Reward Augmentation

    Jul 2, 2026Yaswanth Chittepu, Ativ Joshi, Sohini Chintala +1LLM AlignmentLLM Safety Alignment

  17. Improving LLMs via Validator-to-Generator Alignment

    Jul 2, 2026Juan Diego Rodriguez, Jocelyn Zhang, Katrin Erk +1LLM AlignmentLLM Reliability

  18. On the Limits of Steering Vectors for Preference-Aligned Generation

    Jul 2, 2026Melanie Subbiah, Zara Hall, Kathleen McKeownLLM AlignmentLanguage Model Steering

  19. Distributionally Robust Listwise Preference Optimization

    Jul 2, 2026Xudong Wu, Jian Qian, Pangpang Liu +2LLM AlignmentDistributionally Robust Optimization

  20. Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision

    Jun 30, 2026Xianda Zheng, Huan Gao, Meng-Fen Chiang +3LLM AlignmentMedical VLMs

  21. On the Convergence of Self-Improving Online LLM Alignment

    Jun 30, 2026Xudong Wu, Pangpang Liu, Vaneet Aggarwal +1LLM AlignmentOptimization Convergence Analysis