Causal Interpretability

Momentum

6 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 69

All topics
CardsList
  1. From Concept Alignment to Causal Grounding: An Intervention Test of Chain-of-Thought Faithfulness

    Sep 19, 2026Qianli Wang, Yilong Wang, Dennis Wei +5CoT FaithfulnessLLM Interpretability

  2. Same Outcome, Different Readout: What Does a Steerable Valence Direction in LLMs Represent?

    Sep 19, 2026Weihan Li, Xinlei Chen, Yuhan Song +2Language Model SteeringLLM Interpretability

  3. Splitting the Difference: Interpretable Causal Forests for Treatment Effect Heterogeneity and Bias

    Sep 15, 2026Nicolas Alexander Ihlo, Merle BehrCausal Effect EstimationConditional Average Treatment Effect Estimation

  4. CAS: A Causal Attribution Score for Local and Global Explainable Artificial Intelligence

    Aug 12, 2026Michael Georgiades, Charalambia VarnavaFeature AttributionCausal Attribution

  5. Visualizing Graph-to-Answer Mechanism Recovery in Materials-Science Hypothesis Generation

    Aug 4, 2026Shashwat Sourav, Subhadeep Pal, Markus J. Buehler +4LLM Reasoning with GraphsScientific Hypothesis Generation

  6. GENESIS: Towards Explainable Causal Discovery

    Aug 4, 2026Abhinav Thorat, Ravi Kumar Kolla, Vishak K Bhat +2Causal DiscoveryCausal Structure Learning

  7. Understanding Online Failure Prediction in Linux Through Complementary Multi-View Explainability

    Aug 1, 2026Diogo Dória, João R. CamposFault DetectionCausal Interpretability

  8. Same Evidence, Different Target: Decoding How Diagnostic Evidence Bears on Causal Questions from Language-Model States

    Jul 29, 2026Weiyi Kong, Zhuoran LiCausal Reasoning in Language ModelsCausal Inference

  9. From Training to Deployment: Post-Hoc Causal Feature Identification via Sensitivity Ratios

    Jul 28, 2026Athanasios Vlontzos, Giorgos Papanastasiou, Bernhard Kainz +1Feature AttributionCausal Attribution

  10. LAWFUL: Law-Aligned Witness for Faithful Use of Latents

    Jul 26, 2026Kevin Chen, Kenneth W. Parker, Anish AroraTransformer InterpretabilityMechanistic Interpretability

  11. Beyond Sufficiency: Time Series Explanation with Counterfactual Necessity

    Jul 23, 2026Hongnan Ma, Yiwei Shi, Mengyue Yang +1Counterfactual ExplanationsTime Series Classification

  12. Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects

    Jul 22, 2026Seonglae Cho, Zekun Wu, Kleyton Da Costa +3LLM InterpretabilitySparse Autoencoders

  13. Interventional Causal Circuits for Safe Robot Action Testing and Failure Recovery

    Jul 16, 2026Naren Vasantakumaar, Tom Schierenbeck, Michael BeetzRobot Failure DetectionRobot Failure Recovery

  14. Driving the Wrong Way: Leveraging Interpretability in End2End Autonomous Driving Models

    Jul 7, 2026Franz Motzkus, Sebastian BernhardEnd-to-End Autonomous DrivingInterpretable ML

  15. FinInvest-GTCN: Explainable Graph-Temporal-Causal Modeling for Risk-Aware Investment Decision Optimization

    Jun 27, 2026Junyan Tan, Yifan Li, Minghao Wang +2Temporal GNNsCausal Interpretability

  16. Beyond Shapley: Efficient Computation of Asymmetric Shapley Values

    Jun 23, 2026Ezequiel Companeetz, Santiago Cifuentes, Sergio AbriolaCooperative Game TheoryFeature Attribution

  17. Local Causal Attribution of Chain-of-Thought Reasoning

    Jun 20, 2026Dennis Wei, Yannis Belkhiter, Erik Miehling +1LLM InterpretabilityCausal Attribution

  18. CIExplainer++: Generating Causal and Interpretable Explanations for Graph Neural Networks

    Jun 17, 2026Francisco Caldas, Sahil Satish Kumar, Ruben Belo +1Causal InterpretabilityGNN Explainability

  19. The Representational Limit of Scalar Interactions: An Interventional Decomposition

    Jun 17, 2026Potito Aghilar, Sabino Roccotelli, Stanislao Fidanza +3Feature Interaction ModelingRepresentation Disentanglement

  20. Feature Attribution in Directed Acyclic Graphs Using Edge Intervention

    Jun 13, 2026Qiheng Sun, Junxu Liu, Xiaokai Mao +4Feature AttributionShapley Value Attribution