Causal Interventions in Language Models

Latest papers 317

All topics
CardsList
  1. CASS-RTL: Correctness-Aware Subspace Steering for RTL Generation with LLMs

    Jun 4, 2026Mohammad Akyash, Nowfel Mashnoor, Kimia Azar +1Code GenerationLLM-Based Program Synthesis

  2. Answer Presence Drives RAG Rewriting Gains

    Jun 4, 2026Yuejie Li, Yueying Hua, Ke Yang +8Multi-Hop QARAG Security

  3. Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models

    Jun 3, 2026Yichen Gao, Yiqun Zhang, Zijing Wang +7Audio-Language Model EvaluationAudio Understanding

  4. Expert-Aware Causal Tracing of Factual Recall in Sparse MoE Language Models

    Jun 2, 2026Yuetian Lu, Ali Modarressi, Yihong Liu +1Mixture-of-Experts Language ModelsSparse Mixture-of-Experts

  5. Decomposing how prompting steers behavior

    Jun 2, 2026Fan L. Cheng, Nikolaus KriegeskorteLLM PromptingLLM Interpretability

  6. Multi-component Causal Tracing in Large Language Models

    Jun 2, 2026Zirui Yan, Dennis Wei, Dmitriy A. Katz +2LLM InterpretabilityCausal Reasoning in Language Models

  7. Hallucinations as Orthogonal Noise: Inference-Time Manifold Alignment via Dynamic Contextual Orthogonalization

    Jun 2, 2026Mingkuan Zhao, Wentao Hu, Tianchen Huang +6LLM Hallucination MitigationHallucination in Language Models

  8. Resonant Context Anchoring: Decoupling Attention Routing and Signal Gain at Inference Time

    Jun 1, 2026Mingkuan Zhao, Yide Gao, Wentao Hu +6Contextual FaithfulnessHallucination in Language Models

  9. Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning

    Jun 1, 2026Chuang Ma, Qianying Liu, Tomoyuki Obuchi +6VLM RobustnessVisual Spatial Reasoning

  10. Unlocking the Black Box of Latent Reasoning: An Interpretability-Guided Approach to Intervention

    May 31, 2026Shuochen Chang, Tong Bai, Xiaofeng Zhang +5LLM InterpretabilityCausal Interventions in Language Models

  11. Relational Intervention During Functional Collapse in Large Language Models: A Lexical-Statistical Ablation and a Structure x Register Factorial

    May 31, 2026Franco Santana, Horacio VicoCausal Interventions in Language Models

  12. The Sword, Shield, and Achilles' Heel: Characterizing the Linguistic Inductive Bias of Large Language Models for Spatial Reasoning in Navigation Planning

    May 29, 2026Xudong Zhang, Jian Yang, Shengkai Wang +5Large Language Model-Based Robot PlanningCausal Interventions in Language Models

  13. Neuron-Level Interventions for Gendered and Gender-Neutral Generation in Language Models

    May 29, 2026Zhiwen You, Nafiseh Nikeghbal, Jana DiesnerGender Bias in Language ModelsLLM Interpretability

  14. Counterfactual Graph for Multi-Agent LLM Calibration

    May 28, 2026Jiatan Huang, Mingchen Li, Ziming Li +3AI Agent ReliabilityLanguage Model Calibration

  15. Probing the Prompt KV Cache: Where It Becomes Dispensable

    May 28, 2026Vinayshekhar Bannihatti Kumar, Manoj Ghuhan Arivazhagan, Disha Makhija +1KV CachingKV-Cache Management

  16. Measuring, Localizing, and Ablating Alignment Signatures in LLMs

    May 28, 2026Aniket Anand, Janvijay Singh, Zhewei Sun +2LLM AlignmentAI-Generated Text Detection

  17. Causal Interventions on Continuous Variables: A Case Study on Verb Bias in Steering Vectors for In-Context Learning

    May 28, 2026Zhenghao Herbert Zhou, R. Thomas McCoy, Robert FrankLanguage Model SteeringCausal Reasoning in Language Models

  18. Multi-Adapter Representation Interventions via Energy Calibration

    May 27, 2026Manjiang Yu, Hongji Li, Junwei Chen +4LLM AlignmentLLM Safety Alignment

  19. Cultural Binding Heads in Language Models

    May 27, 2026Avrile Floro, Luca BenedettoLLM InterpretabilityCultural Bias in Language Models

  20. From Fact Overwriting to Knowledge Evolution: Causal Editing via On-Policy Self-Distillation

    May 27, 2026Shuaike Li, Kai Zhang, Xianquan Wang +2Knowledge EditingKnowledge Conflicts in Language Models

  21. ReSAE: Residualized Sparse Autoencoders for Multi-Layer Transformer Interventions

    May 27, 2026Prathyush Poduval, Calvin Yeung, Neel Desai +1Transformer InterpretabilityActivation Sparsity