Causal Interventions in Language Models

Latest papers 317

All topics
CardsList
  1. Right Knowledge, Wrong Answer: Test-Time Steering for Temporal Fact Conflicts in Open-Weight Language Models

    Jun 18, 2026Elias Hossain, Sourav Saha, Umesh Chandra Biswas +1Knowledge Conflicts in Language ModelsTemporal Reasoning in Language Models

  2. Code-Switching Reveals Language Anchoring in Multilingual LLMs

    Jun 18, 2026Jeonghyun Park, Seunghyun Yoon, Yonghyun Jun +1Multilingual Language ModelsCode-Switching

  3. SAE Interventions are Unreliable: Post-Intervention Recovery of Suppressed Behavior

    Jun 16, 2026Mingyue Cui, Linghui Shen, Xingyi YangSparse AutoencodersMechanistic Interpretability

  4. A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models

    Jun 16, 2026Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh +3Audio-Language Model EvaluationAudio-Language Models

  5. Neuron Level Analysis of Large Language Model in Legal Domain Reasoning

    Jun 14, 2026Eri Onami, Youmi Ma, Shuhei Kurita +1Legal NLPLLM Interpretability

  6. Vernier: Probing Representational Misalignment Behind Lexical Gaps in Causal Reasoning

    Jun 14, 2026Zhenyu YuLLM InterpretabilityCausal Reasoning in Language Models

  7. Beyond Importance: Interchange-Sobol Sensitivity Reveals Task-Specific Content Channels in Transformer Components

    Jun 12, 2026Yifeng Guo, Jin-Hong Du, Xiang ChenMechanistic InterpretabilityCausal Interventions in Language Models

  8. A Low-Rank Subspace Analysis of LLM Interventions

    Jun 12, 2026Angira Sharma, Christian Schroeder de Witt, Philip Torr +2LLM InterpretabilityLLM Refusal Behavior

  9. TimeROME-DLM: Temporal Causal Tracing and Low-Rank Inference-Time Knowledge Editing for Masked Diffusion Language Models

    Jun 11, 2026Zhengtao Yao, Liuyang Song, Hongbo Zhang +4Knowledge EditingMasked Diffusion Models

  10. Can Editing 1 Neuron Fix Repetition Loops in LLMs?

    Jun 9, 2026Aristotelis Lazaridis, Aman Sharma, Dylan Bates +3LLM Self-CorrectionMechanistic Interpretability

  11. Steering Where to Listen: Instruction-Based Activation Steering Redirects Temporal Attention in Large Audio-Language Models

    Jun 9, 2026Tsung-En Lin, Hung-Yi LeeLanguage Model SteeringAudio Understanding

  12. From Observation to Intervention: A Causal Audit of Expert Importance in Mixture-of-Experts Models

    Jun 9, 2026Leonard Engmann, Christian Medeiros Adriano, Holger GieseMixture-of-Experts PruningLLM Auditing

  13. Causally Evaluating the Learnability of Formal Language Tasks

    Jun 8, 2026Vésteinn Snæbjarnarson, Anej Svete, Josef Valvoda +3Language ModelingCausal Interventions in Language Models

  14. Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating

    Jun 8, 2026Sicheng Wang, Xiangyang Zhu, Han Wang +6LLM SycophancyLLM Alignment

  15. The Amplifying Mirror: Locating and Steering the Partisan Direction inside a Large Language Model

    Jun 7, 2026Wendy K. TamLLM InterpretabilityPolitical Bias in Language Models

  16. Building Comparative Motivation Profiles with Instrumental Interventions

    Jun 6, 2026David Vella Zarb, Rustem Turtayev, Taywon Min +2LLM Safety EvaluationCausal Interventions in Language Models

  17. When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

    Jun 6, 2026Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang +1Language Model Safety EvaluationLLM Auditing

  18. A Geometric Account of Activation Steering through Angle-Norm Decomposition

    Jun 4, 2026Georgii Aparin, Tatiana GaintsevaLanguage Model SteeringLanguage Modeling

  19. The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment

    Jun 4, 2026Jiachen Zhao, Zhengxuan Wu, Aryaman Arora +3LLM AlignmentLLM Fine-Tuning

  20. The Self-Correction Illusion: LLMs Correct Others but Not Themselves

    Jun 4, 2026Kuan-Yen Chen, Fang-Yi Su, Jung-Hsien ChiangLLM Self-CorrectionLLM Prompting