Causal Interventions in Language Models

Latest papers 317

All topics
CardsList
  1. When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

    Aug 4, 2026Yu Feng, Chunting Zang, Chen Shen +4Language Model Safety EvaluationLLM Guardrails

  2. Activation-Guided Neuron Intervention to Induce Alzheimer's-Related Computational Language Phenotypes in a Large Language Model

    Aug 4, 2026Rui He, Ercong Nie, Hong Jiang +3Alzheimer's DiseaseLLM Interpretability

  3. Understanding Sparse Attention Selectivity in Long-Context Foundation Models via Counterfactual Evaluation

    Aug 3, 2026Xingyu Ren, Youran Sun, Chugang Yi +1LLM AuditingSparse Attention

  4. Bridging the English-Arabic Medical Knowledge Gap: Targeted Low-Rank Adaptation via Causal Layer Selection

    Jul 31, 2026Chaimae Abouzahir, Musa Khan, Hala Ali-Hassan +7LLM Fine-TuningLow-Rank Adaptation

  5. Token-Level Diagnosis of Sycophancy in LLMs with Attribution-Guided Steering

    Jul 31, 2026Hieu Nguyen, Mahammed Kamruzzaman, Anshuman Chhabra +1LLM SycophancyLLM Interpretability

  6. Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations

    Jul 30, 2026Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña LópezLLM PruningLLM Interpretability

  7. Hidden APIs in Language Models: Discovering Reusable Causal Interfaces from Forked Futures

    Jul 30, 2026SiYuan Ma, Yiqin Luo, Zhangji +8LLM InterpretabilityCausal Abstraction

  8. Do Latent Channels Actually Communicate? A Causal Audit of Latent Multi-Agent LLM

    Jul 29, 2026Huixiang Zhang, Mahzabeen EmuLLM AuditingCausal Interventions in Language Models

  9. Steering Instruction Hierarchies at Inference Time

    Jul 28, 2026Siqi Zeng, Sewoong Lee, Han Zhao +1Language Model SteeringLLM Safety Alignment

  10. Sparse Autoencoders Encode Both Concepts and Functions: The Downstream Geometry of Feature Effects

    Jul 27, 2026Phu Gia Hoang, Anwoy Chatterjee, Tanmoy Chakraborty +2Sparse AutoencodersMechanistic Interpretability

  11. Where Animacy Lives in Large Language Models: Tracing the Circuits of the Animacy Concept

    Jul 23, 2026Samuele Punzo, Giovanni Cinà, Sandro PezzelleLLM InterpretabilityCircuits in Language Models

  12. Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects

    Jul 22, 2026Seonglae Cho, Zekun Wu, Kleyton Da Costa +3LLM InterpretabilitySparse Autoencoders

  13. Understanding the Impact of Linguistic Realization Choices on LLM Stance with Causal Tracing

    Jul 22, 2026Langchen Huang, Sebastian Padó, Franziska WeeberPrompt SensitivityLLM Interpretability

  14. CASE: Causal Alignment and Structural Enforcement for Improving Chain-of-Thought Faithfulness

    Jul 21, 2026Ziming Wang, Yinghua Yao, Changwu Huang +2CoT FaithfulnessFaithfulness of Language Model Explanations

  15. Can We Break LLMs Out of Self-Loops? Fine-Grained Reasoning Control with Activation Steering

    Jul 20, 2026Sheldon Yu, Tong Yu, Xunyi Jiang +6Overthinking in Language ModelsCausal Interventions in Language Models

  16. Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs

    Jul 14, 2026Sen Yang, Yuen-Hei YeungLLM AlignmentCausal Interventions in Language Models