Moral Reasoning in Language Models

Latest papers 73

All topics
CardsList
  1. Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts

    Jun 20, 2026Jingting Zheng, Yuqi Ren, Linhao Yu +2LLM EvaluationLLM Alignment

  2. Emergent Alignment

    Jun 17, 2026Martin KolářLLM Self-CorrectionLLM Alignment

  3. Frame-Conditioned Moral Computation in LLaMA 3.1-8B-Instruct: A Mechanistic Interpretability Audit of Ethical Reasoning

    Jun 13, 2026Ali Dasdan, Manan Shah, W. Russell Neuman +3LLM AlignmentMoral Reasoning in Language Models

  4. Harsher on Male? Evaluating LLMs on Gender-Asymmetric Moral Framing Across Diverse Conflict Scenarios

    Jun 12, 2026Guangzong Si, Dong Wang, Zhenhao Li +3Gender Bias in Language ModelsMoral Reasoning in Language Models

  5. LLMs Can Better Capture Human Judgments--With the Right Prompts

    Jun 10, 2026Danica Dillion, Chen Cecilia Liu, Baihui Wang +5Human Preference EvaluationLLM Alignment

  6. Normative Robustness as a Frontier for Non-Verifiable Reasoning in LLMs

    Jun 10, 2026Elizaveta Tennant, Benjamin Henke, Anita Keshmirian +5Moral Reasoning in Language ModelsLanguage Model Robustness

  7. Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

    Jun 10, 2026Zahra Habibzadeh, Paria Khoshtab, Amir Mesbah +1LLM EvaluationLLM Grounding

  8. Are LLMs Bad at Moral Reasoning?

    Jun 10, 2026Menghang Zhu, Seth LazarLLM EvaluationMoral Reasoning in Language Models

  9. Emergent alignment and the projectability of ethical personas

    Jun 8, 2026Guillermo Del Pinal, Youngchan Lee, Calum McNamara +1Moral Reasoning in Language ModelsLanguage Model Safety Evaluation

  10. To Nuke or Not to Nuke: LLMs' (Missing) Ethical Reasoning and Actions in a High-Stakes Decision-Making Simulation

    Jun 6, 2026John Chen, Sihan Cheng, Can Gurkan +1Moral Reasoning in Language ModelsLLM Agent Evaluation

  11. Staying with the Uncertainty: Uncertainty-Scaffolding Strategies for Artificial Moral Advisors in LLM-to-LLM Simulated Conversations

    Jun 4, 2026Salvatore Greco, Hainiu Xu, Jacopo Domenicucci +2Moral Reasoning in Language ModelsAI Alignment

  12. PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

    Jun 3, 2026Hainiu Xu, Italo Luis da Silva, Jiangnan Ye +7LLM Safety BenchmarksMoral Reasoning in Language Models

  13. NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning

    Jun 3, 2026Sichao Li, Sai Ma, Daniel Kilov +3VLM EvaluationMoral Reasoning in Language Models

  14. RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents

    Jun 1, 2026Huayi Lai, Shichao Song, Simin Niu +5Moral Reasoning in Language ModelsAI Agent Benchmarks

  15. Every Act Has Its Price: Compressed Moral Composition in Frontier LLMs

    May 29, 2026Weijia Zhang, Ruiqi Chen, Yunze Xiao +1LLM EvaluationMoral Reasoning in Language Models

  16. Omissive Bias in Religious Representation: Benchmarking LLM Answers to Everyday Ethical Decision-making

    May 23, 2026David Wingate, Sheryl Carty, Joshua Coates +13Moral Reasoning in Language ModelsSocial Bias in Language Models

  17. Naturalistic measure of social norms alignment

    May 22, 2026Yevhen Kostiuk, Kenneth Enevoldsen, Peter Bjerregaard Vahlstrup +2Social DilemmasLLM Evaluation

  18. Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models

    May 5, 2026Chenchen Yuan, Zheyu Zhang, Gjergji KasneciLLM AlignmentMoral Reasoning in Language Models

  19. Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability

    May 4, 2026Yash Aggarwal, Atmika Gorti, Vinija Jain +3Moral Reasoning in Language ModelsSocial Bias in Language Models

  20. Assert, don't describe: Linguistic features that shift LLM reasoning about animal welfare

    Apr 30, 2026Jasmine Brazilek, Harper DunnMoral Reasoning in Language ModelsLanguage Model Post-Training