Moral Reasoning in Language Models

Latest papers 73

All topics
CardsList
  1. Echoes of Deeds: Moral History Can Shape and Steer LLM Behavioral Choices

    Sep 28, 2026Lucio La Cava, Andrea TagarelliMoral Reasoning in Language ModelsLLM Auditing

  2. Human-like moral judgments conceal divergent motive attributions in large language models

    Sep 7, 2026Xiaoyan Wu, Jean-Claude DreherLLM EvaluationMoral Reasoning in Language Models

  3. HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals

    Sep 3, 2026Jasmine Brazilek, Miles Tidmarsh, Matthias Endres +2Moral Reasoning in Language ModelsLLM Safety Alignment

  4. Representational alignment yields generalizable safety in language models

    Sep 3, 2026Lingyu Li, Yan Teng, Yingchun Wang +1Moral Reasoning in Language ModelsLLM Safety Alignment

  5. Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation

    Sep 3, 2026Yuhe Wu, Guangyu Wang, Yujie Chen +7Moral Reasoning in Language ModelsLLM Reliability

  6. Synthetic Persona Pretraining: Alignment from Token Zero

    Aug 13, 2026Julian Minder, Viktor Moskvoretskii, Raghav Singhal +12Synthetic Data PretrainingLLM Alignment

  7. Follow the Norm: Accounting for Fine-Tuning and Prompt Effects on Model Rationales

    Aug 13, 2026Long Hoang Nguyen, Brice Valentin Kok-Shun, Guangyu Du +1Moral Reasoning in Language ModelsNormative Conformity in Language Models

  8. Toward Human Rights Benchmarking for LLMs: A Pilot Methodology

    Aug 10, 2026Savannah Thais, Wm. Matthew Kennedy, Abhigyan Acherjee +3LLM EvaluationMoral Reasoning in Language Models

  9. CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models

    Aug 8, 2026Siddarth Singh, Victoria Williams, Simon Rosen +6LLM EvaluationMoral Reasoning in Language Models

  10. Contextual Value Alignment via Multilayer Combinatorial Fusion

    Aug 7, 2026Yuanhong Wu, Djallel Bouneffouf, D. Frank HsuLLM AlignmentMoral Reasoning in Language Models

  11. Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning

    Jul 23, 2026Baihui Wang, Bernard KochLLM SycophancyMoral Reasoning in Language Models

  12. A Unified Moral-Value Dataset for Instruction Tuning

    Jul 23, 2026Zhaohui Zeng, Florian MaiLLM AlignmentMoral Reasoning in Language Models

  13. Which Values Do LLMs Confuse? A Schwartz-Based Recognition Study

    Jul 22, 2026Andrei Chetvergov, Stepan Ukolov, Timofei Sivoraksha +5LLM EvaluationMoral Reasoning in Language Models

  14. Pancasila-Dilemmas: Evaluating Large Language Models on Indonesian Human Value Dilemmas Grounded in Pancasila

    Jul 20, 2026Supryadi, Irfan, Julianti +4LLM EvaluationLLM Alignment

  15. A Geometric Perspective on Stabilizing Value Conflict Resolution

    Jul 20, 2026Saket Reddy, Andy LiuLLM AlignmentMoral Reasoning in Language Models

  16. MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning

    Jul 13, 2026Ayoung Lee, Ryan Kwon, Yunxiang Zhang +3Multilingual Language Model EvaluationMoral Reasoning in Language Models

  17. Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health

    Jul 12, 2026Asher Sprigler, Yang-Yang Feng, Iftach Amir +5LLM AlignmentMoral Reasoning in Language Models

  18. Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness

    Jul 11, 2026Hong-In Won, Jinseok Jang, Hyoseop KimLLM EvaluationMoral Reasoning in Language Models

  19. Validity of LLMs as data annotators: AMALIA on authority

    Jul 9, 2026Manuel PitaMultilingual Language Model EvaluationMoral Reasoning in Language Models

  20. Can LLMs Imagine Moral Alternatives Beyond Binary Dilemmas?

    Jun 30, 2026Jongchan Choi, Nari Yang, Sung Soo Park +4LLM EvaluationMoral Reasoning in Language Models

  21. Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas

    Jun 27, 2026Ioannis Tzachristas, John PavlopoulosLLM EvaluationMoral Reasoning in Language Models

  22. Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models

    Jun 24, 2026Patrick Cooper, Alvaro VelasquezStructured PromptingMoral Reasoning in Language Models

  23. Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts

    Jun 20, 2026Jingting Zheng, Yuqi Ren, Linhao Yu +2LLM EvaluationLLM Alignment

  24. Emergent Alignment

    Jun 17, 2026Martin KolářLLM Self-CorrectionLLM Alignment

  25. Frame-Conditioned Moral Computation in LLaMA 3.1-8B-Instruct: A Mechanistic Interpretability Audit of Ethical Reasoning

    Jun 13, 2026Ali Dasdan, Manan Shah, W. Russell Neuman +3LLM AlignmentMoral Reasoning in Language Models

  26. Harsher on Male? Evaluating LLMs on Gender-Asymmetric Moral Framing Across Diverse Conflict Scenarios

    Jun 12, 2026Guangzong Si, Dong Wang, Zhenhao Li +3Gender Bias in Language ModelsMoral Reasoning in Language Models

  27. LLMs Can Better Capture Human Judgments--With the Right Prompts

    Jun 10, 2026Danica Dillion, Chen Cecilia Liu, Baihui Wang +5Human Preference EvaluationLLM Alignment

  28. Normative Robustness as a Frontier for Non-Verifiable Reasoning in LLMs

    Jun 10, 2026Elizaveta Tennant, Benjamin Henke, Anita Keshmirian +5Moral Reasoning in Language ModelsLanguage Model Robustness

  29. Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

    Jun 10, 2026Zahra Habibzadeh, Paria Khoshtab, Amir Mesbah +1LLM EvaluationLLM Grounding

  30. Are LLMs Bad at Moral Reasoning?

    Jun 10, 2026Menghang Zhu, Seth LazarLLM EvaluationMoral Reasoning in Language Models

  31. Emergent alignment and the projectability of ethical personas

    Jun 8, 2026Guillermo Del Pinal, Youngchan Lee, Calum McNamara +1Moral Reasoning in Language ModelsLanguage Model Safety Evaluation

  32. To Nuke or Not to Nuke: LLMs' (Missing) Ethical Reasoning and Actions in a High-Stakes Decision-Making Simulation

    Jun 6, 2026John Chen, Sihan Cheng, Can Gurkan +1Moral Reasoning in Language ModelsLLM Agent Evaluation

  33. Staying with the Uncertainty: Uncertainty-Scaffolding Strategies for Artificial Moral Advisors in LLM-to-LLM Simulated Conversations

    Jun 4, 2026Salvatore Greco, Hainiu Xu, Jacopo Domenicucci +2Moral Reasoning in Language ModelsAI Alignment

  34. PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

    Jun 3, 2026Hainiu Xu, Italo Luis da Silva, Jiangnan Ye +7LLM Safety BenchmarksMoral Reasoning in Language Models

  35. NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning

    Jun 3, 2026Sichao Li, Sai Ma, Daniel Kilov +3VLM EvaluationMoral Reasoning in Language Models

  36. RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents

    Jun 1, 2026Huayi Lai, Shichao Song, Simin Niu +5Moral Reasoning in Language ModelsAI Agent Benchmarks

  37. Every Act Has Its Price: Compressed Moral Composition in Frontier LLMs

    May 29, 2026Weijia Zhang, Ruiqi Chen, Yunze Xiao +1LLM EvaluationMoral Reasoning in Language Models

  38. Omissive Bias in Religious Representation: Benchmarking LLM Answers to Everyday Ethical Decision-making

    May 23, 2026David Wingate, Sheryl Carty, Joshua Coates +13Moral Reasoning in Language ModelsSocial Bias in Language Models

  39. Naturalistic measure of social norms alignment

    May 22, 2026Yevhen Kostiuk, Kenneth Enevoldsen, Peter Bjerregaard Vahlstrup +2Social DilemmasLLM Evaluation

  40. Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models

    May 5, 2026Chenchen Yuan, Zheyu Zhang, Gjergji KasneciLLM AlignmentMoral Reasoning in Language Models

  41. Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability

    May 4, 2026Yash Aggarwal, Atmika Gorti, Vinija Jain +3Moral Reasoning in Language ModelsSocial Bias in Language Models

  42. Assert, don't describe: Linguistic features that shift LLM reasoning about animal welfare

    Apr 30, 2026Jasmine Brazilek, Harper DunnMoral Reasoning in Language ModelsLanguage Model Post-Training