Moral Reasoning in Language Models

Latest papers 73

All topics
CardsList
  1. Echoes of Deeds: Moral History Can Shape and Steer LLM Behavioral Choices

    Sep 28, 2026Lucio La Cava, Andrea TagarelliMoral Reasoning in Language ModelsLLM Auditing

  2. Human-like moral judgments conceal divergent motive attributions in large language models

    Sep 7, 2026Xiaoyan Wu, Jean-Claude DreherLLM EvaluationMoral Reasoning in Language Models

  3. HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals

    Sep 3, 2026Jasmine Brazilek, Miles Tidmarsh, Matthias Endres +2Moral Reasoning in Language ModelsLLM Safety Alignment

  4. Representational alignment yields generalizable safety in language models

    Sep 3, 2026Lingyu Li, Yan Teng, Yingchun Wang +1Moral Reasoning in Language ModelsLLM Safety Alignment

  5. Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation

    Sep 3, 2026Yuhe Wu, Guangyu Wang, Yujie Chen +7Moral Reasoning in Language ModelsLLM Reliability

  6. Synthetic Persona Pretraining: Alignment from Token Zero

    Aug 13, 2026Julian Minder, Viktor Moskvoretskii, Raghav Singhal +12Synthetic Data PretrainingLLM Alignment

  7. Follow the Norm: Accounting for Fine-Tuning and Prompt Effects on Model Rationales

    Aug 13, 2026Long Hoang Nguyen, Brice Valentin Kok-Shun, Guangyu Du +1Moral Reasoning in Language ModelsNormative Conformity in Language Models

  8. Toward Human Rights Benchmarking for LLMs: A Pilot Methodology

    Aug 10, 2026Savannah Thais, Wm. Matthew Kennedy, Abhigyan Acherjee +3LLM EvaluationMoral Reasoning in Language Models

  9. CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models

    Aug 8, 2026Siddarth Singh, Victoria Williams, Simon Rosen +6LLM EvaluationMoral Reasoning in Language Models

  10. Contextual Value Alignment via Multilayer Combinatorial Fusion

    Aug 7, 2026Yuanhong Wu, Djallel Bouneffouf, D. Frank HsuLLM AlignmentMoral Reasoning in Language Models

  11. Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning

    Jul 23, 2026Baihui Wang, Bernard KochLLM SycophancyMoral Reasoning in Language Models

  12. A Unified Moral-Value Dataset for Instruction Tuning

    Jul 23, 2026Zhaohui Zeng, Florian MaiLLM AlignmentMoral Reasoning in Language Models

  13. Which Values Do LLMs Confuse? A Schwartz-Based Recognition Study

    Jul 22, 2026Andrei Chetvergov, Stepan Ukolov, Timofei Sivoraksha +5LLM EvaluationMoral Reasoning in Language Models

  14. Pancasila-Dilemmas: Evaluating Large Language Models on Indonesian Human Value Dilemmas Grounded in Pancasila

    Jul 20, 2026Supryadi, Irfan, Julianti +4LLM EvaluationLLM Alignment

  15. A Geometric Perspective on Stabilizing Value Conflict Resolution

    Jul 20, 2026Saket Reddy, Andy LiuLLM AlignmentMoral Reasoning in Language Models

  16. MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning

    Jul 13, 2026Ayoung Lee, Ryan Kwon, Yunxiang Zhang +3Multilingual Language Model EvaluationMoral Reasoning in Language Models

  17. Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health

    Jul 12, 2026Asher Sprigler, Yang-Yang Feng, Iftach Amir +5LLM AlignmentMoral Reasoning in Language Models

  18. Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness

    Jul 11, 2026Hong-In Won, Jinseok Jang, Hyoseop KimLLM EvaluationMoral Reasoning in Language Models

  19. Validity of LLMs as data annotators: AMALIA on authority

    Jul 9, 2026Manuel PitaMultilingual Language Model EvaluationMoral Reasoning in Language Models

  20. Can LLMs Imagine Moral Alternatives Beyond Binary Dilemmas?

    Jun 30, 2026Jongchan Choi, Nari Yang, Sung Soo Park +4LLM EvaluationMoral Reasoning in Language Models

  21. Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas

    Jun 27, 2026Ioannis Tzachristas, John PavlopoulosLLM EvaluationMoral Reasoning in Language Models

  22. Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models

    Jun 24, 2026Patrick Cooper, Alvaro VelasquezStructured PromptingMoral Reasoning in Language Models