LLM Alignment

LLM: Large Language Model

Latest papers 422

All topics
CardsList
  1. From Static Personal Values to Contextualized Personalization: Bayesian Personalized Value Alignment for LLMs

    Sep 24, 2026Hanze Guo, Aixuan Song, Jing Yao +4LLM AlignmentPersonalized Language Models

  2. Evaluating Feedback Focus and Pedagogical Adaptivity in LLM-Generated Feedback on Student Writing

    Sep 23, 2026Norah Almousa, Shayan Peyghambari Oskoui, Raquel Coelho +3LLM EvaluationLLM Alignment

  3. Syndrome, Synergy, and Safety: Structured Reasoning and Knowledge-Driven Alignment for TCM Prescription Generation

    Sep 22, 2026Zheng Chen, ZhiCheng Du, Haoxuan Li +1LLM AlignmentCoT Reasoning

  4. Alignment Forecasting: Predicting Misalignment From Training Data

    Sep 19, 2026Chen Yueh-Han, Bruce W. Lee, Ilia Sucholutsky +1LLM AlignmentEmergent Misalignment in Language Models

  5. Stress-testing Alignment Midtraining

    Sep 17, 2026Sid Baines, Jonathan Bostock, Maria Angelica Martinez +3LLM AlignmentLanguage Model Post-Training

  6. Benchmarking LLM Compliance with China AI Generated Content Regulations

    Sep 17, 2026Chenrui Cui, Hongye Fang, Lisha Song +3LLM Safety BenchmarksLLM Alignment

  7. AUDITPLAN: Commit, Then Answer for Auditable Safety Alignment

    Sep 16, 2026Sai Sri Pushpa Jampani, Kshitij Mishra, Asif EkbalLLM AlignmentLLM Auditing

  8. A Zeroth-Order Paradigm for LLM Preference Alignment

    Sep 16, 2026Peter Chen, Xi Chen, Wotao Yin +1Pairwise Preference LearningLLM Alignment

  9. Inoculation Midtraining with Learned Neologisms

    Sep 14, 2026Kyle O'Brien, Edward James Young, Puria Radmard +4LLM AlignmentLLM Safety

  10. Beyond Safe Answers: Segment-Aware Listwise Alignment for Reasoning Safety in Large Reasoning Models

    Sep 14, 2026JungMin Yun, Junehyoung Kwon, Hayeong Ryu +3LLM AlignmentDirect Preference Optimization

  11. Toward Robust Personalized Alignment for LLMs: Mitigating Persona Drift in Multi-Turn Dialogue

    Sep 14, 2026Youyuan Zhang, Siyuan Li, Fangming Liu +1Belief RevisionLLM Alignment

  12. Direct Preference Density Alignment for Conversational Audio Equalization

    Sep 14, 2026Ioannis Stylianou, Sven Ewan Shepstone, Jon Francombe +2RL for Language ModelsLLM Alignment

  13. One Example Is Enough to Pass Fairness Benchmarks: Rethinking Fairness Evaluation for Aligned LLMs

    Sep 14, 2026Naihao Deng, Samee Arif, Shuaichen Chang +2LLM EvaluationLLM Alignment

  14. Suan: Rectifying Direct Preference Safety Alignment in Large Language Models

    Sep 8, 2026Oleksandr Cherednichenko, Roman KlypaLLM AlignmentLLM Safety Alignment

  15. From Echo Chambers to Epistemic Monoculture: Large Language Models Present Temporally Contingent Partisan Alignments as Knowledge

    Sep 7, 2026Wend K. TamLLM AlignmentLLM Interpretability

  16. The Profit Alignment Problem: How Profit Mandates Induce Alignment Failures in LLMs

    Sep 7, 2026Eric SoLLM AlignmentLanguage Model Safety Evaluation

  17. Probing the Structure and Dynamics of LLM Value Expression through Value Conflicts

    Sep 7, 2026Kaicheng Zhang, Jingyi Xiao, Renjun Hu +3LLM AlignmentLLM Safety Evaluation

  18. No country for old linguists: LLM-brain alignment underdetermines neural computation

    Sep 2, 2026Elliot MurphyLLM AlignmentNeural Encoding

  19. Thinking effort aligns between humans and reasoning models in abductive reasoning

    Sep 1, 2026Henry ArthurLLM AlignmentCognitive Modeling

  20. Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation

    Sep 1, 2026Thibaut Thonet, Jos Rozen, Laurent BesacierLLM AlignmentTTS Evaluation

  21. Post-hoc Alignment of LLM-judges to Human Judgment Distribution

    Sep 1, 2026Sebastian Steindl, Nikos Voskarides, Alberto Gasparin +1Soft-Label LearningLLM Alignment

  22. Mind the Gap: Theory-of-Mind-Grounded Friction for Epistemic Alignment

    Aug 31, 2026Yifan Zhu, Kyeongmin Rim, James PustejovskyLLM AlignmentPragmatic Reasoning in Language Models