6 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.
Sep 30, 2026·Beiming Liu, Minjie ChenCircuits in Language ModelsCausal Interpretability
PetroChina Southwest Oil and Gasfield Company, China
Sep 28, 2026·Amir Mohammadpour, Michael FrankeBayesian InferenceCausal Reasoning in Language Models
Department of Linguistics, University of Tübingen
Sep 19, 2026·Qianli Wang, Yilong Wang, Dennis Wei +5CoT FaithfulnessLLM Interpretability
Technische Universität Berlin · German Research Center for Artificial Intelligence (DFKI) · IBM Research +4
Sep 19, 2026·Weihan Li, Xinlei Chen, Yuhan Song +2Language Model SteeringLLM Interpretability
The University of Tokyo · Harbin Institute of Technology, Shenzhen · The Hong Kong University of Science and Technology
Sep 15, 2026·Nicolas Alexander Ihlo, Merle BehrCausal Effect EstimationConditional Average Treatment Effect Estimation
Faculty of Informatics and Data Science University of Regensburg, Germany
Sep 13, 2026·Orion Reblitz-RichardsonLLM InterpretabilityCausal Interpretability
Distiller Labs
Sep 1, 2026·Xining XunCausal InterpretabilityCausal Interventions in Language Models
Tsingjiao Information Science (Beijing) Co., Ltd.
Aug 12, 2026·Michael Georgiades, Charalambia VarnavaFeature AttributionCausal Attribution
Department of Computer Science Neapolis University Pafos Cyprus · CaSToRC The Cyprus Institute Nicosia, Cyprus
Aug 12, 2026·Xining XunCausal Representation LearningLLM Auditing
Aug 4, 2026·Shashwat Sourav, Subhadeep Pal, Markus J. Buehler +4LLM Reasoning with GraphsScientific Hypothesis Generation
Department of Physics, Washington University in St. Louis · Oak Ridge National Laboratory · Lawrence Berkeley National Laboratory +6
Aug 4, 2026·Abhinav Thorat, Ravi Kumar Kolla, Vishak K Bhat +2Causal DiscoveryCausal Structure Learning
User Engagement Research, Sony Research India
Aug 1, 2026·Diogo Dória, João R. CamposFault DetectionCausal Interpretability
University of Coimbra, CISUC/LASI Department of Informatics Engineering Coimbra, Portugal
Jul 31, 2026·Xining XunCausal DiscoveryCausal Reasoning in Language Models
Jul 29, 2026·Weiyi Kong, Zhuoran LiCausal Reasoning in Language ModelsCausal Inference
University of Toronto, Toronto, Canada · The University of Hong Kong, Hong Kong
Jul 28, 2026·Athanasios Vlontzos, Giorgos Papanastasiou, Bernhard Kainz +1Feature AttributionCausal Attribution
Hologen AI London, UK · Mathematics Research Centre Academy of Athens Athens, GR · FAU Erlangen Nuremberg Imperial College London Erlangen, DE & London, UK +1
Jul 26, 2026·Kevin Chen, Kenneth W. Parker, Anish AroraTransformer InterpretabilityMechanistic Interpretability
Computer Science & Engineering, The Ohio State University, Columbus, Ohio, USA · Independent Researcher, Waterford, Virginia, USA
Jul 23, 2026·Hongnan Ma, Yiwei Shi, Mengyue Yang +1Counterfactual ExplanationsTime Series Classification
School of Computer Science, University of Bristol · School of Engineering Mathematics and Technology, University of Bristol
Jul 22, 2026·Seonglae Cho, Zekun Wu, Kleyton Da Costa +3LLM InterpretabilitySparse Autoencoders
Holistic AI · University College London
Jul 21, 2026·Sarwan AliLLM InterpretabilityGenomics
Columbia University Irving Medical Center, New York, USA
Jul 16, 2026·Naren Vasantakumaar, Tom Schierenbeck, Michael BeetzRobot Failure DetectionRobot Failure Recovery
Institute for Artificial Intelligence, University of Bremen
Jul 13, 2026·Mohamed Abdessalem BalFeature SuperpositionNeural Representation Geometry
Independent Researcher, Algiers, Algeria
Jul 7, 2026·Franz Motzkus, Sebastian BernhardEnd-to-End Autonomous DrivingInterpretable ML
AUMOVIO, Germany · University of Bamberg, Germany
Jun 30, 2026·Philippe Chlenski, Zachariah Carmichael, Ayush Warikoo +5Faithfulness of Language Model ExplanationsLLM Interpretability
1Meta.
Jun 27, 2026·Junyan Tan, Yifan Li, Minghao Wang +2Temporal GNNsCausal Interpretability
Department of Computer Science Zhejiang University
Jun 25, 2026·Amadeo TunyiMultivariate Time Series ForecastingSurrogate Modeling
XITASO GmbH Austraße 35, 86153 Augsburg, Germany
Jun 23, 2026·Ezequiel Companeetz, Santiago Cifuentes, Sergio AbriolaCooperative Game TheoryFeature Attribution
Departamento de Computación, Facultad de Ciencias Exactas y Naturales, UBA · Instituto de Ciencias de la Computación (ICC), CONICET
Jun 20, 2026·Dennis Wei, Yannis Belkhiter, Erik Miehling +1LLM InterpretabilityCausal Attribution
1IBM Research.
Jun 17, 2026·Francisco Caldas, Sahil Satish Kumar, Ruben Belo +1Causal InterpretabilityGNN Explainability
NOVA LINCS, NOVA School of Science and Technology, Lisbon, Portugal
Jun 17, 2026·Potito Aghilar, Sabino Roccotelli, Stanislao Fidanza +3Feature Interaction ModelingRepresentation Disentanglement
Polytechnic University of Bari · University of Bari Aldo Moro
Jun 13, 2026·Qiheng Sun, Junxu Liu, Xiaokai Mao +4Feature AttributionShapley Value Attribution
The Hong Kong Polytechnic University, Hong Kong, China · Zhejiang University, Hangzhou, China · University of Illinois Urbana-Champaign, Urbana, USA