Deception in Language Models

Latest papers 56

All topics
CardsList
  1. LLM Semantic Signaling Game and Mechanism Design: Systematic Blindness, Awareness Shaping, and Mindset Dynamics

    Jun 27, 2026Quanyan ZhuDeception in Language ModelsLLM Security

  2. Defeat Devices in AI Systems

    Jun 27, 2026Emilio FerraraDeception in Language ModelsAI Safety Evaluation

  3. Is Lying an Emergent Behaviour in LLMs? Evidence from Gaslighting AI agents in a Sustainability Game

    Jun 26, 2026Subhendu Bhandary, Federico Carucci, Christos Charalambous +6Multi-Agent LLM SystemsDeception in Language Models

  4. Manipulation Is Task-Dependent: A Multi-Axis, Multi-Environment Evaluation of Frontier LLMs

    Jun 24, 2026Adeeb Zaman, Erik Nordby, Fred HeidingLLM EvaluationLanguage Model Safety Evaluation

  5. Probing the Misaligned Thinking Process of Language Models

    Jun 23, 2026Kaiwen Zhou, Constantin Venhoff, Jonathan Michala +2LLM AlignmentLLM Auditing

  6. Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing

    Jun 16, 2026Kexin Chen, Yi Liu, Haonan Zhang +3LLM AuditingLLM Interpretability

  7. RogueAI: A Reverse Turing Test for Detecting Licensed AI Deception in Dialogue

    Jun 11, 2026Sara Candussio, Emanuele Ballarin, Lorenzo Bonin +2AI Agent ReliabilityLanguage Model Safety Evaluation

  8. Janus: A Benchmark for Goal-Conditioned Information Distortion in LLMs

    Jun 9, 2026Polydoros Giannouris, Mohsinul Kabir, Sophia AnaniadouLLM EvaluationDeception in Language Models

  9. When LLMs Learn to Be Consistently Wrong: A Multi-Model Study of Linear Representations of Synthetic Deception

    May 28, 2026Vahideh ZolfaghariLinear ProbingLanguage Model Safety Evaluation

  10. The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages

    May 27, 2026Eric Onyame, Runtao Zhou, Kowshik Thopalli +2CoT FaithfulnessMultilingual Language Model Evaluation

  11. Evolving and Detecting Multi-Turn Deception using Geometric Signatures

    May 26, 2026Surender Suresh Kumar, Mary L. CummingsAdversarial Prompt GenerationDeception in Language Models

  12. DECOR: Auditing LLM Deception via Information Manipulation Theory

    May 19, 2026Linyue Cai, Samuel Yeh, Jwala Dhamala +2Language Model Safety EvaluationLLM Auditing

  13. Confidently Deceptive: On the Relationship Between Confidence and Deception in LLMs

    May 12, 2026Ali Asad, Stephen Obadinma, Anshul Pattoo +2Language Model Safety EvaluationConfidence Estimation in Language Models

  14. Do Linear Probes Generalize Better in Persona Coordinates?

    May 10, 2026Prasad Mahadik, Adrians SkaparsLanguage Model Safety EvaluationDeception in Language Models

  15. Tatemae: Detecting Alignment Faking via Tool Selection in LLMs

    Apr 29, 2026Matteo Leonesi, Francesco Belardinelli, Flavio Corradini +1Deception in Language ModelsLLM Safety Alignment

  16. Value-Conflict Diagnostics Reveal Widespread Alignment Faking in Language Models

    Apr 22, 2026Inderjeet Nair, Jie Ruan, Lu WangLLM AlignmentLanguage Model Safety Evaluation

  17. Large language models can effectively convince people to believe conspiracies

    Jan 8, 2026Thomas H. Costello, Kellin Pelrine, Matthew Kowal +6Deception in Language ModelsLLM Safety

  18. When Do Large Language Models Exhibit Unsolicited Deception?

    Mar 31, 2025Samuel M. Taylor, Benjamin K. BergenLanguage Model Safety EvaluationDeception in Language Models