Moral Reasoning in Language Models

Latest papers 73

All topics
CardsList
  1. Do LLMs Hold Their Values? MANTA: A Multi-Turn Adversarial Benchmark for Animal Welfare Reasoning

    Apr 18, 2026Isabella Luong, Joyee Chen, Arturs Kanepajs +5LLM EvaluationMoral Reasoning in Language Models

  2. Jailbreaking Large Language Models with Morality Attacks

    Apr 18, 2026Ying Su, Mingen Zheng, Weili Diao +1Moral Reasoning in Language ModelsLanguage Model Safety Evaluation

  3. On the Context Sensitivity of LLM Moral Judgment

    Mar 24, 2026Adrian Sauter, Mona SchirmerMoral Reasoning in Language ModelsMoral Reasoning

  4. CoMMET: A Psychologically Grounded Benchmark for Evaluating Theory of Mind in Multimodal LLMs

    Mar 12, 2026Ruirui Chen, Weifeng Jiang, Chengwei Qin +3Moral Reasoning in Language ModelsTheory of Mind

  5. Untangling Input Language from Reasoning Language: A Diagnostic Framework for Cross-Lingual Moral Alignment in LLMs

    Jan 15, 2026Nan Li, Bo Kang, Tijl De BieMultilingual Language Model EvaluationLLM Alignment

  6. Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate

    Oct 11, 2025Pratik S. Sachdeva, Tom van NuenenLLM AlignmentMoral Reasoning in Language Models