LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. Adaptive Pluralistic Alignment: A pipeline for dynamic artificial democracy

    May 2, 2026Rachel FreedmanReward ModelingLLM Alignment

  2. TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization

    Apr 30, 2026Abdulhady Abas Abdullah, Fatemeh Daneshfar, Seyedali Mirjalili +1LLM AlignmentDirect Preference Optimization

  3. Mind the Gap: Structure-Aware Consistency in Preference Learning

    Apr 30, 2026Mehryar Mohri, Yutao ZhongPairwise Preference LearningLLM Alignment

  4. Debiasing Reward Models via Causally Motivated Inference-Time Intervention

    Apr 30, 2026Kazutoshi Shinoda, Kosuke Nishida, Kyosuke NishidaReward ModelingLLM Alignment

  5. Three Models of RLHF Annotation: Extension, Evidence, and Authority

    Apr 28, 2026Steve CoyneLLM AlignmentHuman-in-the-Loop Annotation

  6. One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement

    Apr 28, 2026Yixiao Zhou, Dongzhou Cheng, zhiliang wu +3LLM AlignmentRL for Language Model Reasoning

  7. Generating Place-Based Compromises Between Two Points of View

    Apr 27, 2026Sumanta Bhattacharyya, Francine Chen, Scott Carter +6LLM AlignmentPrompt Engineering

  8. Intrinsic Mutual Information as a Modulator for Preference Optimization

    Apr 27, 2026Peng Liao, Peijia Zheng, Lingbo Li +2LLM AlignmentOffline Preference Optimization

  9. Hindsight Preference Optimization for Financial Time Series Advisory

    Apr 27, 2026Yanwei Cui, Guanghui Wang, Xing Zhang +7LLM AlignmentFinancial Forecasting

  10. LLMs Reading the Rhythms of Daily Life: Aligned Understanding for Behavior Prediction and Generation

    Apr 26, 2026Fanjin Meng, Jingtao Ding, Nian Li +2LLM AlignmentHuman Behavior Simulation

  11. Pref-CTRL: Preference Driven LLM Alignment using Representation Editing

    Apr 26, 2026Imranul Ashrafi, Inigo Jauregi Unanue, Massimo PiccardiLLM AlignmentRepresentation Engineering

  12. AI Safety Training Can be Clinically Harmful

    Apr 25, 2026Suhas BN, Andrew M. Sherrill, Rosa I. Arriaga +2Mental Health CounselingLLM Alignment

  13. Controllable Spoken Dialogue Generation: An LLM-Driven Grading System for K-12 Non-Native English Learners

    Apr 24, 2026Haidong Yuan, Haokun Zhao, Wanshi Xu +4RL for Language ModelsLLM Alignment

  14. Multilingual Refusal Alignment for Safer Large Language Models

    Apr 24, 2026Aleksandra Krasnodębska, Wojciech Kusa, Aldo LipaniMultilingual Language Model EvaluationLLM Alignment

  15. Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization

    Apr 24, 2026Weixu Zhang, Ye Yuan, Changjiang Han +7LLM AlignmentLanguage Model Steering

  16. CAP: Controllable Alignment Prompting for Unlearning in LLMs

    Apr 23, 2026Zhaokun Wang, Jinyu Guo, Jingwen Pu +7LLM AlignmentLLM Unlearning

  17. Propensity Inference: Environmental Contributors to LLM Behaviour

    Apr 22, 2026Olli Järviniemi, Oliver Makins, Jacob Merizian +2LLM AlignmentLLM Auditing

  18. Value-Conflict Diagnostics Reveal Widespread Alignment Faking in Language Models

    Apr 22, 2026Inderjeet Nair, Jie Ruan, Lu WangLLM AlignmentLanguage Model Safety Evaluation

  19. To Intervene or Not: Guiding Inference-time Alignment with Probabilistic Model Blending

    Apr 22, 2026Jin Gan, Xin Li, Jun LuoLLM AlignmentInference-Time Language Model Alignment

  20. HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

    Apr 22, 2026Darsh Kachroo, Arjun Prasaath Anbazhagan, Adriana Caraeni +2LLM AlignmentDirect Preference Optimization

  21. AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards

    Apr 21, 2026Yiming Pan, Chengwei Hu, Xuancheng Huang +6LLM AlignmentReinforcement Learning with Verifiable Rewards

  22. OLLM: Options-based Large Language Models

    Apr 21, 2026Shashank Sharma, Janina Hoffmann, Vinay NamboodiriLLM AlignmentRL for Language Model Reasoning

  23. Local Linearity of LLMs Enables Activation Steering via Model-Based Linear Optimal Control

    Apr 21, 2026Julian Skifstad, Xinyue Annie Yang, Glen ChouLLM AlignmentLanguage Model-Based Control

  24. Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints

    Apr 20, 2026Hao Meng, Siyuan Zheng, Shuran Zhou +2Text-to-Music GenerationLLM Alignment

  25. Towards Disentangled Preference Optimization Dynamics: Suppress the Loser, Preserve the Winner

    Apr 20, 2026Wei Chen, Yubing Wu, Junmei Yang +5Pairwise Preference LearningLLM Alignment

  26. Characterizing Model-Native Skills

    Apr 19, 2026Feiyang Kang, Mahavir Dabas, Myeongseob Ko +1LLM AlignmentLLM Training