LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. Towards Physical Intuitions for Alignment Dynamics: A Case Study With Randomness Crystallization

    Jun 29, 2026Kunal Samanta, Ari Holtzman, Peter WestLLM AlignmentLLM Fine-Tuning

  2. Mechanistically Eliciting Latent Behaviors in Language Models

    Jun 28, 2026Andrew Mack, Nina Panickssery, Alexander Matt TurnerLLM AlignmentLanguage Model Safety Evaluation

  3. Beyond the Mean: Three-Axis Fidelity for Aligning LLM-Based Survey Simulators from Small Pilot Data

    Jun 27, 2026Eun Cheol Choi, Youngrae Kim, Prabhu Pugalenthi +2LLM AlignmentLLM Fine-Tuning

  4. GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning

    Jun 25, 2026Ting Zhou, Zhenqing Ling, Yiyang Zhao +2RL for Language ModelsLLM Alignment

  5. AIGP: An LLM-Based Framework for Long-Term Value Alignment in E-Commerce Pricing

    Jun 25, 2026Chennan Ma, Yanning Zhang, Siqi Hong +3LLM AlignmentDynamic Pricing

  6. NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research

    Jun 25, 2026Qiaobo Hao, Yangqian Wu, Shunyi Wang +5Supervised Fine-TuningRL for Language Models

  7. OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

    Jun 24, 2026Wenxuan Jiang, Zining Fan, Zijian Zhang +6Open-Ended GenerationIntrinsic Reward Methods

  8. PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models

    Jun 24, 2026Chang Wu, Junfeng Fang, Houcheng Jiang +5LLM AlignmentLLM Safety Alignment

  9. A Survey of Toxicity Detection and Mitigation Strategies for Multilingual Language Models

    Jun 24, 2026Soham Dan, Himanshu Beniwal, Thomas HartvigsenMultilingual Language ModelsLLM Alignment

  10. Transformer-Based Language Models Across Domain Verticals: Architectures, Applications and Critical Assessment

    Jun 23, 2026Guruprakash J, Krithika L. BLLM EvaluationLLM Alignment

  11. Probing the Misaligned Thinking Process of Language Models

    Jun 23, 2026Kaiwen Zhou, Constantin Venhoff, Jonathan Michala +2LLM AlignmentLLM Auditing

  12. Reinforcement Learning Towards Broadly and Persistently Beneficial Models

    Jun 22, 2026Akshay V. Jagadeesh, Rahul K. Arora, Khaled Saab +5LLM AlignmentLLM Safety Alignment

  13. Towards Spec Learning: Inference-Time Alignment from Preference Pairs

    Jun 22, 2026Dhriti Krishnan, Tejas Goyal, Jaromir SavelkaLLM AlignmentPrompt Optimization

  14. On the Limits of Prompt-Conditioned Language Models as General-Purpose Learners

    Jun 22, 2026David Mguni, Julian Ma, Jun WangLLM AlignmentLLM Prompting

  15. Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts

    Jun 22, 2026Arthur Wuhrmann, Gaetan Stein, Daniel Brunner +1Multilingual Language Model EvaluationLegal NLP

  16. Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts

    Jun 20, 2026Jingting Zheng, Yuqi Ren, Linhao Yu +2LLM EvaluationLLM Alignment

  17. Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding

    Jun 20, 2026Xuanming Zhang, Sining Zhoubian, Yuxuan Chen +8LLM AlignmentLanguage Model Decoding

  18. AI Alignment From Social Choice Perspectives

    Jun 19, 2026Daniel Halpern, Evi Micha, Ariel D. Procaccia +3LLM AlignmentAI Alignment

  19. Towards Pedagogically Aligned LLM Tutors for Math Mistake Remediation

    Jun 19, 2026Kseniia Petukhova, Tien Dat Nguyen, Ekaterina KochmarLLM AlignmentIntelligent Tutoring Systems

  20. What Shapes Emergent Misalignment? Insights from Training Dynamics, Model Priors, and Data

    Jun 18, 2026Yuchen Zhang, Anietta Weckauff, Diego Garcia-Olano +1LLM EvaluationLLM Alignment

  21. Your Mouse and Eyes Secretly Leak Your Preference: LLM Alignment using Implicit Feedback from Users

    Jun 18, 2026Haw-Shiuan Chang, Jeffrey Gomez, Mehul Patwari +2Reward ModelingLLM Alignment

  22. Editorial Alignment: A Participatory Approach to Engaging Editorial Expertise in LLM-mediated Knowledge Dissemination

    Jun 18, 2026Simon Aagaard Enni, Malthe Stavning Erslev, Karl-Emil Kjær Bilstrup +1LLM Alignment

  23. Which Pairs to Compare for LLM Post-Training?

    Jun 17, 2026Jiangze Han, Vineet Goyal, Will MaPairwise Preference LearningPairwise Comparison

  24. Tracking Representation Dynamics in Large Language Models with Persistent Homology

    Jun 17, 2026Naman Malhotra, Jay Ambadkar, Abhinav Gupta +4LLM AlignmentLLM Fine-Tuning

  25. Emergent Alignment

    Jun 17, 2026Martin KolářLLM Self-CorrectionLLM Alignment

  26. Beyond Safe Data: Pretraining-Stage Alignment with Regular Safety Reflection

    Jun 17, 2026Jinhan Li, Kexian Tang, Yihan Xu +2Language Model PretrainingLLM Alignment