Causal Interpretability

Momentum

6 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 69

All topics
CardsList
  1. CADET: Physics-Grounded Causal Auditing and Training-Free Deconfounding of End-to-End Driving Planners

    Jun 12, 2026Zikun GuoEnd-to-End Autonomous DrivingAutonomous Driving Planning

  2. Observable Patterns Are Not Explanations: A Causal-Geometric Analysis of Latent Reasoning Models

    Jun 10, 2026Darpan Aswal, Thomas Palmeira Ferraz, Yongxin Zhou +1Continuous Latent ReasoningCausal Interpretability

  3. From Observation to Intervention: A Causal Audit of Expert Importance in Mixture-of-Experts Models

    Jun 9, 2026Leonard Engmann, Christian Medeiros Adriano, Holger GieseMixture-of-Experts PruningLLM Auditing

  4. Many Circuits, One Mechanism: Input Variation and Evaluation Granularity in Circuit Discovery

    Jun 4, 2026Alireza Bayat Makou, Jingcheng Niu, Subhabrata Dutta +1Circuit DiscoveryMechanistic Interpretability

  5. LLM Explainability with Counterfactual Chains and Causal Graphs

    Jun 4, 2026Nirit Nussbaum-Hoffer, Nitay Calderon, Liat Ein-Dor +1LLM Reasoning with GraphsLLM Interpretability

  6. Output Type Before Quality: A Standards-Derived XAI Admissibility Rubric for Autonomous-Driving Safety

    Jun 3, 2026Abhinaw Priyadershi, Mandar Pitale, Jelena Frtunikj +1AI AssuranceAutonomous Driving Safety Evaluation

  7. MechRL: Reinforcement Learning Agents Perform Circuit Discovery for Mechanistic Interpretability

    May 25, 2026Barsat KhadkaTransformer InterpretabilityCircuit Discovery

  8. Causal Tongue-Tie: LLMs Can Encode Causal Direction, But Their Yes/No Outputs Fail to Express

    May 25, 2026Ziyi Ding, Xiao-Ping ZhangLLM EvaluationCausal Reasoning in Language Models

  9. Represented Is Not Computed: A Causal Test of Candidate Algorithmic Intermediates in a Transformer

    May 21, 2026Ishita Darade, Sushrut ThoratNumerical Reasoning in Language ModelsTransformer Interpretability

  10. From Circuit Evidence to Mechanistic Theory: An Inductive Logic Approach

    May 20, 2026Nura Aljaafari, Danilo S. Carvalho, Andre FreitasCircuit DiscoveryMechanistic Interpretability

  11. Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models

    May 19, 2026Guangzhi Xiong, Qiao Jin, Sanchit Sinha +2Medical VQAVLM Interpretability

  12. Learning Quantifiable Visual Explanations Without Ground-Truth

    May 18, 2026Amritpal Singh, Andrey Barsky, Mohamed Ali Souibgui +2Perturbation-Based Feature AttributionCausal Interpretability

  13. OCCAM: Open-set Causal Concept explAnation and Ontology induction for black-box vision Models

    May 18, 2026Chiara Maria Russo, Simone Carnemolla, Simone Palazzo +3Explainable Artificial IntelligenceConcept-Based Explanations

  14. Causal Explanations from the Geometric Properties of ReLU Neural Networks

    May 11, 2026Hector Woods, Philippa Ryan, Rob AlexanderNeural Network InterpretabilityCausal Explanation

  15. Semiparametric Efficient Test for Interpretable Distributional Treatment Effects

    May 8, 2026Houssam Zenati, Arthur GrettonSemiparametric InferenceCausal Effect Estimation

  16. Radiologist-Guided Causal Concept Bottleneck Models for Chest X-Ray Interpretation

    May 8, 2026Amy Rafferty, Rishi Ramaesh, Ajitha RajanChest X-Ray ClassificationConcept Bottleneck Models

  17. Concept-Based Abductive and Contrastive Explanations for Behaviors of Vision Models

    May 7, 2026Ronaldo Canizales, Divya Gopinath, Corina Păsăreanu +1Abductive ReasoningConcept-Based Explanations

  18. Bucketing the Good Apples: A Method for Diagnosing and Improving Causal Abstraction

    May 4, 2026Li Puyin, Jiyuan Tan, Ahmad Jabbar +2Mechanistic InterpretabilityCausal Abstraction

  19. ISAAC: Auditing Causal Reasoning in Deep Models for Drug-Target Interaction

    May 3, 2026Barbara Tarantino, Sun Kim, Yijingxiu Lu +1Reasoning EvaluationCausal Interpretability

  20. Embodied Interpretability: Linking Causal Understanding to Generalization in Vision-Language-Action Models

    May 1, 2026Hanxin Zhang, Mingshuo Xu, Abdulqader Dhafer +3VLM RobustnessVLM Interpretability

  21. Causal Learning with Neural Assemblies

    Apr 29, 2026Evangelia Kopadi, Dimitris KallesNeural ProcessesCausal Discovery