Causal Interpretability

Momentum

6 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 69

All topics
CardsList
  1. From Concept Alignment to Causal Grounding: An Intervention Test of Chain-of-Thought Faithfulness

    Sep 19, 2026Qianli Wang, Yilong Wang, Dennis Wei +5CoT FaithfulnessLLM Interpretability

  2. Same Outcome, Different Readout: What Does a Steerable Valence Direction in LLMs Represent?

    Sep 19, 2026Weihan Li, Xinlei Chen, Yuhan Song +2Language Model SteeringLLM Interpretability

  3. Splitting the Difference: Interpretable Causal Forests for Treatment Effect Heterogeneity and Bias

    Sep 15, 2026Nicolas Alexander Ihlo, Merle BehrCausal Effect EstimationConditional Average Treatment Effect Estimation

  4. CAS: A Causal Attribution Score for Local and Global Explainable Artificial Intelligence

    Aug 12, 2026Michael Georgiades, Charalambia VarnavaFeature AttributionCausal Attribution

  5. Visualizing Graph-to-Answer Mechanism Recovery in Materials-Science Hypothesis Generation

    Aug 4, 2026Shashwat Sourav, Subhadeep Pal, Markus J. Buehler +4LLM Reasoning with GraphsScientific Hypothesis Generation

  6. GENESIS: Towards Explainable Causal Discovery

    Aug 4, 2026Abhinav Thorat, Ravi Kumar Kolla, Vishak K Bhat +2Causal DiscoveryCausal Structure Learning

  7. Understanding Online Failure Prediction in Linux Through Complementary Multi-View Explainability

    Aug 1, 2026Diogo Dória, João R. CamposFault DetectionCausal Interpretability

  8. Same Evidence, Different Target: Decoding How Diagnostic Evidence Bears on Causal Questions from Language-Model States

    Jul 29, 2026Weiyi Kong, Zhuoran LiCausal Reasoning in Language ModelsCausal Inference

  9. From Training to Deployment: Post-Hoc Causal Feature Identification via Sensitivity Ratios

    Jul 28, 2026Athanasios Vlontzos, Giorgos Papanastasiou, Bernhard Kainz +1Feature AttributionCausal Attribution

  10. LAWFUL: Law-Aligned Witness for Faithful Use of Latents

    Jul 26, 2026Kevin Chen, Kenneth W. Parker, Anish AroraTransformer InterpretabilityMechanistic Interpretability

  11. Beyond Sufficiency: Time Series Explanation with Counterfactual Necessity

    Jul 23, 2026Hongnan Ma, Yiwei Shi, Mengyue Yang +1Counterfactual ExplanationsTime Series Classification

  12. Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects

    Jul 22, 2026Seonglae Cho, Zekun Wu, Kleyton Da Costa +3LLM InterpretabilitySparse Autoencoders

  13. Interventional Causal Circuits for Safe Robot Action Testing and Failure Recovery

    Jul 16, 2026Naren Vasantakumaar, Tom Schierenbeck, Michael BeetzRobot Failure DetectionRobot Failure Recovery

  14. Driving the Wrong Way: Leveraging Interpretability in End2End Autonomous Driving Models

    Jul 7, 2026Franz Motzkus, Sebastian BernhardEnd-to-End Autonomous DrivingInterpretable ML

  15. FinInvest-GTCN: Explainable Graph-Temporal-Causal Modeling for Risk-Aware Investment Decision Optimization

    Jun 27, 2026Junyan Tan, Yifan Li, Minghao Wang +2Temporal GNNsCausal Interpretability

  16. Beyond Shapley: Efficient Computation of Asymmetric Shapley Values

    Jun 23, 2026Ezequiel Companeetz, Santiago Cifuentes, Sergio AbriolaCooperative Game TheoryFeature Attribution

  17. Local Causal Attribution of Chain-of-Thought Reasoning

    Jun 20, 2026Dennis Wei, Yannis Belkhiter, Erik Miehling +1LLM InterpretabilityCausal Attribution

  18. CIExplainer++: Generating Causal and Interpretable Explanations for Graph Neural Networks

    Jun 17, 2026Francisco Caldas, Sahil Satish Kumar, Ruben Belo +1Causal InterpretabilityGNN Explainability

  19. The Representational Limit of Scalar Interactions: An Interventional Decomposition

    Jun 17, 2026Potito Aghilar, Sabino Roccotelli, Stanislao Fidanza +3Feature Interaction ModelingRepresentation Disentanglement

  20. Feature Attribution in Directed Acyclic Graphs Using Edge Intervention

    Jun 13, 2026Qiheng Sun, Junxu Liu, Xiaokai Mao +4Feature AttributionShapley Value Attribution

  21. CADET: Physics-Grounded Causal Auditing and Training-Free Deconfounding of End-to-End Driving Planners

    Jun 12, 2026Zikun GuoEnd-to-End Autonomous DrivingAutonomous Driving Planning

  22. Observable Patterns Are Not Explanations: A Causal-Geometric Analysis of Latent Reasoning Models

    Jun 10, 2026Darpan Aswal, Thomas Palmeira Ferraz, Yongxin Zhou +1Continuous Latent ReasoningCausal Interpretability

  23. From Observation to Intervention: A Causal Audit of Expert Importance in Mixture-of-Experts Models

    Jun 9, 2026Leonard Engmann, Christian Medeiros Adriano, Holger GieseMixture-of-Experts PruningLLM Auditing

  24. Many Circuits, One Mechanism: Input Variation and Evaluation Granularity in Circuit Discovery

    Jun 4, 2026Alireza Bayat Makou, Jingcheng Niu, Subhabrata Dutta +1Circuit DiscoveryMechanistic Interpretability

  25. LLM Explainability with Counterfactual Chains and Causal Graphs

    Jun 4, 2026Nirit Nussbaum-Hoffer, Nitay Calderon, Liat Ein-Dor +1LLM Reasoning with GraphsLLM Interpretability

  26. Output Type Before Quality: A Standards-Derived XAI Admissibility Rubric for Autonomous-Driving Safety

    Jun 3, 2026Abhinaw Priyadershi, Mandar Pitale, Jelena Frtunikj +1AI AssuranceAutonomous Driving Safety Evaluation

  27. MechRL: Reinforcement Learning Agents Perform Circuit Discovery for Mechanistic Interpretability

    May 25, 2026Barsat KhadkaTransformer InterpretabilityCircuit Discovery

  28. Causal Tongue-Tie: LLMs Can Encode Causal Direction, But Their Yes/No Outputs Fail to Express

    May 25, 2026Ziyi Ding, Xiao-Ping ZhangLLM EvaluationCausal Reasoning in Language Models

  29. Represented Is Not Computed: A Causal Test of Candidate Algorithmic Intermediates in a Transformer

    May 21, 2026Ishita Darade, Sushrut ThoratNumerical Reasoning in Language ModelsTransformer Interpretability

  30. From Circuit Evidence to Mechanistic Theory: An Inductive Logic Approach

    May 20, 2026Nura Aljaafari, Danilo S. Carvalho, Andre FreitasCircuit DiscoveryMechanistic Interpretability

  31. Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models

    May 19, 2026Guangzhi Xiong, Qiao Jin, Sanchit Sinha +2Medical VQAVLM Interpretability

  32. Learning Quantifiable Visual Explanations Without Ground-Truth

    May 18, 2026Amritpal Singh, Andrey Barsky, Mohamed Ali Souibgui +2Perturbation-Based Feature AttributionCausal Interpretability

  33. OCCAM: Open-set Causal Concept explAnation and Ontology induction for black-box vision Models

    May 18, 2026Chiara Maria Russo, Simone Carnemolla, Simone Palazzo +3Explainable Artificial IntelligenceConcept-Based Explanations

  34. Causal Explanations from the Geometric Properties of ReLU Neural Networks

    May 11, 2026Hector Woods, Philippa Ryan, Rob AlexanderNeural Network InterpretabilityCausal Explanation

  35. Semiparametric Efficient Test for Interpretable Distributional Treatment Effects

    May 8, 2026Houssam Zenati, Arthur GrettonSemiparametric InferenceCausal Effect Estimation

  36. Radiologist-Guided Causal Concept Bottleneck Models for Chest X-Ray Interpretation

    May 8, 2026Amy Rafferty, Rishi Ramaesh, Ajitha RajanChest X-Ray ClassificationConcept Bottleneck Models

  37. Concept-Based Abductive and Contrastive Explanations for Behaviors of Vision Models

    May 7, 2026Ronaldo Canizales, Divya Gopinath, Corina Păsăreanu +1Abductive ReasoningConcept-Based Explanations

  38. Bucketing the Good Apples: A Method for Diagnosing and Improving Causal Abstraction

    May 4, 2026Li Puyin, Jiyuan Tan, Ahmad Jabbar +2Mechanistic InterpretabilityCausal Abstraction

  39. ISAAC: Auditing Causal Reasoning in Deep Models for Drug-Target Interaction

    May 3, 2026Barbara Tarantino, Sun Kim, Yijingxiu Lu +1Reasoning EvaluationCausal Interpretability

  40. Embodied Interpretability: Linking Causal Understanding to Generalization in Vision-Language-Action Models

    May 1, 2026Hanxin Zhang, Mingshuo Xu, Abdulqader Dhafer +3VLM RobustnessVLM Interpretability

  41. Causal Learning with Neural Assemblies

    Apr 29, 2026Evangelia Kopadi, Dimitris KallesNeural ProcessesCausal Discovery