Causal Interventions in Language Models

Latest papers 317

All topics
CardsList
  1. Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs

    Jul 8, 2026Anupam Wagle, Ifrat Ikhtear Uddin, Chaowei Zhang +1LLM InterpretabilityAdversarial Attacks on LLMs

  2. Distributed Sparse Interventions in Language Models

    Jul 8, 2026Maximilian S. Ernst, Lorenz Linhardt, Aaron Peikert +1Language Model SteeringLLM Interpretability

  3. Final Checkpoints Are Not Enough: Analyzing Latent Reasoning Faithfulness Along Training Trajectories

    Jul 7, 2026Hengyu Jin, Shu Yang, Di WangCoT FaithfulnessContinuous Latent Reasoning

  4. Reward Valuation in Large Language Models: Causal Induction of Anhedonia

    Jul 7, 2026Melika Honarmand, Samin Mahdipour Aghabagher, Martin SchrimpfReward ModelingCognitive Modeling

  5. Controlling Tool Use with Heading-Specific Activation Steering

    Jul 7, 2026Yuqi Chen, Vincent Siu, Yang Liu +2Language Model SteeringLLM Tool Use

  6. A Coin Flip Per Token: Bernoulli Sparse Steering of Large Language Models

    Jul 6, 2026Nima Eshraghi, Lovedeep Gondara, Yuqing Huang +5Language Model SteeringSparse Autoencoders

  7. Faithfulness to Refusal: A Causal Audit of Neuron Selectors

    Jul 6, 2026Ananth Eswar, Pratinav Seth, Utsav Avaiya +1Transformer InterpretabilityFeature Attribution

  8. Can Dialects Be Steered Like Languages? Sparse Neurons and Distributed Directions in Arabic LLMs

    Jul 4, 2026Kareem Elozeiri, Mervat Abassy, Omar Kallas +4Arabic NLPLLM Interpretability

  9. Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits

    Jul 2, 2026Zhiren Gong, He Lu, Tiantong Wang +6Circuit DiscoveryMechanistic Interpretability

  10. Auditing Forgetting in Limited Memory Language Models

    Jul 1, 2026Arya Raeesi, Hanna RoedMemory-Augmented Language ModelsLLM Auditing

  11. Readable but Not Controllable: Neuron-Level Evidence for Medical LLM Hallucination

    Jun 30, 2026Vijay Vankadaru, Asha Matthews, Tanya Roosta +1LLM Hallucination MitigationLLM Interpretability

  12. Mechanistically Eliciting Latent Behaviors in Language Models

    Jun 28, 2026Andrew Mack, Nina Panickssery, Alexander Matt TurnerLLM AlignmentLanguage Model Safety Evaluation

  13. Do Models Read What They Write? Causal Registers in Scratchpad Reasoning

    Jun 28, 2026Benjamin Shih, John Winnicki, Eric DarveCoT FaithfulnessCoT Reasoning

  14. Invariant Reasoning Directions in Latent Trajectories of Language Models

    Jun 28, 2026Arun Vignesh Malarkkan, Manan Roy Choudhury, Utkarsh Byahut +3Reasoning Consistency in Language ModelsImplicit Reasoning in Language Models

  15. Mechanistic Personality Analysis of LLMs Steering Personality via Latent Feature Interventions

    Jun 27, 2026David Courtis, Ting HuLanguage Model SteeringLLM Interpretability

  16. Forecasting With LLMs: Improved Generalization Through Feature Steering

    Jun 25, 2026Humzah Merchant, Bradford LevyLanguage Model SteeringLLM Interpretability

  17. Refusal Lives Downstream of Persona in Chat Models

    Jun 24, 2026Viola Zhong, Qirui LiLanguage Model SteeringLLM Refusal Behavior

  18. First-Token Broadcasters: Mechanistic Origins of Language Identity and Distributed Robustness in Transformers

    Jun 21, 2026Arjun Pillai, Christian Hoang, Anjelo Jann LarozaMultilingual Language ModelsLLM Interpretability

  19. Curiosity as Linguistic Intervention: Using LLM Tutoring Dialogues to Influence Exploratory Learning Behavior

    Jun 21, 2026Gevindu Ganganath, Pasindu Bolonghege, Qianru Lyu +2Intelligent Tutoring SystemsIntrinsic Motivation

  20. A Validation-Gated Mechanistic Account of Suicidality Detection in LLMs

    Jun 19, 2026Nafiz Ahmed, Sarah Sharif, Dingjing Shi +1LLM InterpretabilityMental Health