Causal Interventions in Language Models

Latest papers 317

All topics
CardsList
  1. Who Drives the Probability Game of VLMs? A Temporal Causal Drive Evaluation Framework

    Sep 2, 2026Shuyao Xiao, Shengling Wang, Haoyu Niu +4VLM EvaluationVLM Interpretability

  2. Probing Factual Knowledge Transfer with Training Data Interventions

    Sep 1, 2026Romina Oji, Marc Braun, Marcel Bollmann +2Language Model PretrainingMultilingual Language Model Evaluation

  3. Some Emotions Run Deeper: Layer-wise Probing and Causal Intervention in Large Language Models

    Sep 1, 2026Tian Fang, Gaël Guibon, Davide BuscaldiCausal Interventions in Language ModelsEmotion Representation in Language Models

  4. CopyShield: A Cross-Level Benchmark of Copyright Defenses in LLMs

    Sep 1, 2026Maryam Alshehyari, Dushyant Singh Chauhan, Samuele Poppi +3LLM Safety BenchmarksDirect Preference Optimization

  5. StateSwap: Probing Support-Elimination Hidden States in Multiple-Choice Questions

    Sep 1, 2026Chao Gao, Haijiang Liu, Qiyuan Li +3Prompt SensitivityMultiple-Choice Question Answering

  6. Context-Grounding Gains Are Mediated by Pre-existing Machinery: Auditing GRPO, SFT, and DPO

    Sep 1, 2026Prakhar Gupta, Vaibhav GuptaRL for Language ModelsLLM Grounding

  7. How Do Language Models Choose Between Context and Memory?

    Sep 1, 2026Benjamin Shih, John Winnicki, Arianna CaoKnowledge Conflicts in Language ModelsLLM Interpretability

  8. Latent Mechanisms of Language Control in Multilingual Language Models

    Aug 31, 2026Ryo Mitsuhashi, Sabri Boughorbel, Majd HawaslyMultilingual Language ModelsMultilingual Language Model Evaluation

  9. The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal

    Aug 31, 2026Md Mokarram Chowdhury, Ernie Chang, Yang LiJailbreak AttacksLLM Jailbreak Attacks

  10. Enhancing Low-Resource Language Reasoning via High-Resource Language Feature Transfer

    Aug 31, 2026Minju Song, Hyeon Hwang, Junhyun Lee +1Cross-Lingual Reasoning in Language ModelsLow-Resource Language Processing

  11. When Errors Become Memories: Causal Pathway Tracing in Multi-Turn Memory-Augmented LLMs

    Aug 31, 2026Shuyao Xiao, Shengling Wang, Xuan Chen +8Memory-Augmented Language ModelsCausal Interventions in Language Models

  12. Locating and Controlling Implicit Personalization in Large Language Models

    Aug 12, 2026Yueru Yan, Siqi Wu, Thai LeLLM PersonalizationLLM Interpretability

  13. Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

    Aug 12, 2026Mingyu Zong, Sampad Mohanty, Bhaskar KrishnamachariLLM AlignmentLLM Interpretability

  14. Data Attribution of Emergent Misalignment with Persona Features

    Aug 11, 2026Clemens Vetter, David Kaczér, Lucie Flek +1LLM AlignmentEmergent Misalignment in Language Models

  15. Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases

    Aug 11, 2026Davood Wadi, Mohsen Ghodrat, Matthew PhilpLLM EvaluationCultural Bias in Language Models

  16. Decodable But Not Detachable: Training Data Granularity Determines Parametric Modularity in Large Language Models

    Aug 10, 2026Marcus Armstrong, Navid Ayoobi, Arjun MukherjeeLLM InterpretabilityCircuits in Language Models

  17. Thinking vs. NoThinking: Towards Interpreting Reasoning Mechanisms of Large Language Models via Sparse Autoencoders

    Aug 8, 2026Bo Cheng, Qiaolin Lu, Yi Chang +1LLM InterpretabilityCoT Reasoning

  18. The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

    Aug 6, 2026Zhiheng Wang, Bo Peng, Lai Wei +1Tool Use in VLMsVisually Grounded Reasoning

  19. Recovering Lesion Parameters from Aphasic Picture Naming Error Profiles in Large Language Models

    Aug 5, 2026Yong Yang, Roger Newman-Norlund, Xiang Guan +10LLM InterpretabilityCausal Interventions in Language Models