CoT Monitoring

CoT: Chain-of-Thought

Momentum

4 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 21

All topics
CardsList
  1. Reasoning-Token Spikes Under Prompted Untruthful Responding in Large Language Models

    Oct 7, 2026Maverick Morales, Tomáš Dominik, Vermut Gao +4Deception in Language ModelsLLM Auditing

  2. On Language Drift during RLVR Post-Training

    Oct 1, 2026Michael Sullivan, Alexander KollerRL for Language Model ReasoningReinforcement Learning with Verifiable Rewards

  3. Hidden Reasoning Must Leak, but Need Not Be Readable: Fundamental Opportunities and Limits for Chain-of-Thought Monitoring

    Sep 29, 2026Mohammadali Mohammadkhani, Madhava Krishna, Yash Sarrof +1CoT MonitoringLarge Reasoning Models

  4. Corrupt Plans, Clean Traces: Evading Chain-of-Thought Monitoring with Plan Injection

    Sep 14, 2026Keertana Chidambaram, Andrew Ilyas, Vasilis SyrgkanisLLM SecurityPrompt Injection Attacks on AI Agents

  5. The Answer Is Not the Argument

    Aug 31, 2026Will Yeadon, Sergio Juárez, Paul Mackay +5LLM Answer VerificationCoT Monitoring

  6. Does Out-of-Sight Equal Out-of-Mind in CoT Monitorability?

    Aug 5, 2026Pedro Ferreira, Wilker Aziz, Ivan TitovCoT MonitoringLatent CoT Reasoning

  7. Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings

    Aug 5, 2026Agatha Duzan, Asa Cooper SticklandLLM Safety BenchmarksCoT Monitoring

  8. Evading Chain-of-Thought Monitoring Through Model Poisoning

    Aug 3, 2026Giorgio Severi, Shujaat Mirza, Blake Bullwinkel +1LLM Backdoor AttacksLLM Auditing

  9. Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring

    Jul 9, 2026Jennifer Za, Julija Bainiaksina, Nikita Ostrovsky +2Language Model Safety EvaluationAdversarial Attacks on LLMs

  10. The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages

    May 27, 2026Eric Onyame, Runtao Zhou, Kowshik Thopalli +2CoT FaithfulnessMultilingual Language Model Evaluation

  11. Training on Documents About Monitoring Leads to CoT Obfuscation

    May 14, 2026Reilly Haskins, Bilal Chughtai, Joshua EngelsCoT Monitoring

  12. CoT-Guard: Small Models for Strong Monitoring

    May 12, 2026Nirav Diwan, Han Wang, Berkcan Kapusuzoglu +6LLM AuditingAdversarial Attacks on LLMs

  13. Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through Oversight

    May 7, 2026Christopher Z. Cui, Taylor W. Killian, Prithviraj AmmanabroluScalable OversightLLM Safety

  14. Detecting and Suppressing Reward Hacking with Gradient Fingerprints

    Apr 17, 2026Songtao Wang, Quang Hieu Pham, Fangcong Yin +4Reward HackingReinforcement Learning with Verifiable Rewards

  15. MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models

    Mar 30, 2026Han Wang, Yifan Sun, Brian Ko +8CoT FaithfulnessLLM Evaluation

  16. A False Average: Pooled CoT-Monitor Accuracy Conceals a Reasoning-Dependent Fragility

    Date pendingShikhar Shiromani, Leo RichterReward HackingAdversarial Attacks on LLMs