Causal Interventions in Language Models

Latest papers 317

All topics
CardsList
  1. Why LLMs Fail at Causal Discovery and How Interventional Agents Escape

    May 26, 2026Amartya Roy, Sonali ParbhooCausal DiscoveryCausal Reasoning in Language Models

  2. Beyond a Single Direction: Chain-of-Thought Disrupts Simple Steering of Refusal

    May 26, 2026Kia-Jüng Yang, Dominik Meier, Jiachen Zhao +2CoT ReasoningLLM Refusal Behavior

  3. Causal methods for LLM development and evaluation

    May 25, 2026Dennis Frauen, Marie Brockschmidt, Konstantin Hess +10LLM EvaluationCausal Inference

  4. CausalFlow: Causal Attribution and Counterfactual Repair for LLM Agent Failures

    May 25, 2026Akash Bonagiri, Devang Borkar, Gerard Janno Anderias +2Agent Failure AnalysisCausal Interventions in Language Models

  5. Transformer Field Theory: A Response-Theoretic Approach to Mechanistic Interpretability

    May 24, 2026David N. Olivieri, Antonio F. Pérez RodríguezTransformer InterpretabilityMechanistic Interpretability

  6. Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning

    May 22, 2026Jinghan Jia, Joe Benton, Eric EasleyCoT FaithfulnessLLM Interpretability

  7. Represented Is Not Computed: A Causal Test of Candidate Algorithmic Intermediates in a Transformer

    May 21, 2026Ishita Darade, Sushrut ThoratNumerical Reasoning in Language ModelsTransformer Interpretability

  8. Diagnosis Is Not Prescription: Linguistic Co-Adaptation Explains Patching Hazards in LLM Pipelines

    May 21, 2026Yoon Jeonghun, Kim DongchanLLM AgentsCausal Interventions in Language Models

  9. Causal Evidence for Attention Head Imbalance in Modality Conflict Hallucination

    May 19, 2026Jinrui Jiang, Zhangtai Wu, Zhen Wu +1Hallucination in Language ModelsMultimodal Large Language Models

  10. Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents

    May 17, 2026Saksham Sahai SrivastavaConversational MemoryLong-Term Conversational Memory

  11. To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents

    May 16, 2026Wei Shi, Ziheng Peng, Sihang Li +4Tool-Augmented Language Model AgentsCausal Interventions in Language Models

  12. Artificial Aphasias in Lesioned Language Models

    May 15, 2026Nathan Roll, Jill Kries, Laura Gwilliams +1LLM InterpretabilityCausal Interventions in Language Models

  13. Non-linear Interventions on Large Language Models

    May 14, 2026Sangwoo KimLLM InterpretabilityCausal Interventions in Language Models

  14. Does RAG Know When Retrieval Is Wrong? Diagnosing Context Compliance under Knowledge Conflict

    May 14, 2026Yihang Chen, Pin Qian, Su Wang +4Retrieval-Augmented GenerationKnowledge Conflicts in Language Models

  15. Faithful or Fabricated? A Causal Framework for Rationalization Bias in LLM Judges

    May 13, 2026Riya Tapwal, Abhishek Kumar, Carsten MapleLLM-as-a-JudgeFaithfulness of Language Model Explanations

  16. Not Just RLHF: Why Alignment Alone Won't Fix Multi-Agent Sycophancy

    May 13, 2026Adarsh Kumarappan, Ananya MujooAI Agent ReliabilityMulti-Agent LLM Systems

  17. When Attention Closes: How LLMs Lose the Thread in Multi-Turn Interaction

    May 13, 2026Vardhan Dongre, Joseph Hsieh, Viet Dac Lai +3Self-AttentionLLM Interpretability

  18. Temporal Preference Concepts and their Functions in a Large Language Model

    May 11, 2026Ian Rios-Sialer, Shantanu Darveshi, Shuai Jiang +4LLM InterpretabilityTemporal Reasoning in Language Models

  19. Prompt-Activation Duality: Improving Activation Steering via Attention-Level Interventions

    May 11, 2026Diancheng Kang, Zheyuan Liu, Ningshan Ma +3Language Model SteeringSelf-Attention