Deception in Language Models

Latest papers 56

All topics
CardsList
  1. Reasoning-Token Spikes Under Prompted Untruthful Responding in Large Language Models

    Oct 7, 2026Maverick Morales, Tomáš Dominik, Vermut Gao +4Deception in Language ModelsLLM Auditing

  2. DecepEval: A Benchmark for Evaluating Deception in LLM Agents

    Oct 6, 2026Yiming Xu, Hongyue Yu, Beihua Yang +8Deception in Language ModelsLLM Agent Evaluation

  3. Before Agent Tells The Lie: Has Deception Already Been Represented?

    Oct 5, 2026Xinling Li, Dadi Guo, Qingyu Liu +5LLM InterpretabilityDeception in Language Models

  4. Stress-Testing LLM Lie Detectors: Role-Play Failures and Spurious Correlations

    Sep 30, 2026Maximilian von Klinski, Sebastian Lapuschkin, Wojciech Samek +1Deception in Language ModelsLLM Reliability

  5. Unlearning Deceptive Behaviors in LLMs with Contrastive Forget Sets

    Sep 30, 2026Haoran Tang, Rajiv KhannaDeception in Language ModelsMachine Unlearning

  6. Selecting The Most Informative Tokens in Natural Language Autoencoders

    Sep 29, 2026Federico Torrielli, Gianluca Barmina, Andrea Blasi Núñez +4LLM AuditingAutoencoders

  7. Language Models Are "Insecure" Reporters

    Sep 28, 2026Jenny Y. Huang, Jiameng Fan, Ahmed Imtiaz Humayun +5Language Model Safety EvaluationDeception in Language Models

  8. Steering Language Model Goals with Value Transplant

    Sep 28, 2026Pengcheng Jiang, Fabien RogerLanguage Model SteeringLanguage Model-Based Control

  9. How does Adversarial Influence Scale in Multi-Agent Systems?

    Sep 24, 2026Addison J. Wu, Jasin Cekinmez, Michel Liao +2Multi-Agent LLM SystemsDeception in Language Models

  10. Fabrication After Tool Failure: Tool-Augmented Agents Assert Values Their Tools Did Not Return

    Sep 13, 2026Arham Sethi, Arsen Kenzhebayev, Saanvi Paturi +3Tool-Augmented Language Model AgentsDeception in Language Models

  11. Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs

    Aug 12, 2026Nimet Beyza Bozdag, Emre Can Acikgoz, Gokhan Tur +1Deception in Language ModelsAdversarial Attacks on LLMs

  12. Theory-Guided Deception Detection: A RAG-Based Artificial Intelligence Exploration

    Aug 9, 2026David M. Markowitz, Timothy R. LevineRetrieval-Augmented GenerationDeception in Language Models

  13. Sweet Little Lies: Strategic Deception in AI Emotional Support Chatbots

    Aug 2, 2026Aseem Pahuja, Zhiling Guo, Tahir Abbas SyedEmotional Support ConversationDeception in Language Models

  14. Paying for Honesty Without Knowing the Truth: Reputation-Penalty Design for LLM Marketplace Agents

    Jul 30, 2026Mingdai Yang, Shicheng Fan, Kejing Yu +5Agent ReliabilityDeception in Language Models

  15. Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game

    Jul 30, 2026Niklas Bauer, Lars Benedikt Kaesberg, Akiko Aizawa +3Multi-Agent LLM SystemsSocial Deduction Games

  16. Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

    Jul 28, 2026Marylou Fauchard, Florian Carichon, Margarida Carvalho +1Multi-Agent LLM SystemsDeception in Language Models

  17. Every Model Cheats: Prompt-Level Mitigation of Cheating on Offensive Cyber Tasks

    Jul 23, 2026Michael Kouremetis, Ads Dawson, Raja Sekhar Rao Dheekonda +1LLM AuditingDeception in Language Models

  18. Transcoders for Investigating Deception in Language Models

    Jul 16, 2026Darius Lim, Nathan Leow, Xin Wei ChiaDeception in Language ModelsCircuits in Language Models

  19. When Agents Lie: Premeditation, Persistence, and Exploitation in Repeated Games

    Jul 6, 2026Jerick Shi, Terry Jingcheng Zhang, Bernhard Schölkopf +2Multi-Agent LLM SystemsGame-Playing Agents

  20. Scaling Trends for Lie Detector Oversight in Preference Learning

    Jul 2, 2026Oskar J. Hollinsworth, Ann-Kathrin Dombrowski, Sam Adam-Day +2Scalable OversightDeception in Language Models

  21. Fuzzing Large Language Models to Elicit Hidden Behaviours

    Jun 28, 2026Mohammed Abu Baker, Lakshmi Babu-SaheerLLM Backdoor AttacksLLM Auditing