Neural Network Interpretability

Latest papers 203

All topics
CardsList
  1. Effects of sparsity and superposition on loss in simple autoencoders

    Jun 16, 2026Mriganka Basu Roy Chowdhury, Eric McLaughlin WeinerFeature SuperpositionActivation Sparsity

  2. Input-Dependent Fisher Information for Local Sensitivity Analysis of Medical Image Classifiers

    Jun 15, 2026Sourya Sengupta. Mark A. AnastasioNeural Network InterpretabilityMedical Image Classification

  3. When Confidence Lacks Concepts: Interpretable OOD Detection via Representation Perturbations

    Jun 15, 2026Anju Chhetri, Pratik Shrestha, Ramesh Rana +3Medical Image Anomaly DetectionNeural Network Interpretability

  4. Analyzing Visual Aircraft Representations with Sparse Autoencoders

    Jun 13, 2026Deepshik SharmaVisual Representation LearningSparse Autoencoders

  5. Sparsified Kolmogorov-Arnold Networks for Interpretable Quantum State Tomography

    Jun 10, 2026Xinge Wu, Huaxin Wang, Jiajun Liu +4Quantum State TomographyNeural Network Interpretability

  6. DeceptionX: Explainable Deception Detection with Multimodal Large Language Models

    Jun 9, 2026Jiayu Zhang, Shuo Ye, Jiajian Huang +7Multimodal Large Language ModelsMultimodal Reasoning

  7. From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs

    Jun 8, 2026Wish Suharitdamrong, Muhammad Awais, Xiatian Zhu +1Efficient Multimodal InferenceMultimodal Large Language Models

  8. Interactions Between Crosscoder Features: A Compact Proofs Perspective

    Jun 8, 2026Dmitry Manning-Coe, Thomas Read, Anna Soligo +4Feature Interaction ModelingSparse Autoencoders

  9. A spectral audit framework reveals task-dependent aperiodic reliance across EEG and ECG deep learning

    Jun 7, 2026Jasmeet Singh Bindra, Siddharth PanwarElectroencephalographyTime Series Classification

  10. When Are Neural Interaction Discoveries Real? Identifiability, Recoverability, and a Pre-Fit Diagnostic

    Jun 7, 2026Valentina Kuskova, Dmitry Zaytsev, Michael CoppedgeFeature Interaction ModelingParameter Identifiability

  11. Enhancing AI Interpretability and Safety through Localised Architectures

    Jun 6, 2026Ian Seet, Jonas Bozenhard, Simon OstermannEnergy-Efficient MLInterpretable ML

  12. Beyond Accuracy: Interpreting Topic Representation in Suicide Ideation Detection Models

    Jun 5, 2026Hamideh Ghanadian, Isar Nejadgholi, Hussein Al OsmanData AugmentationMental Health

  13. OPTIMUS-Prime: Minimal and Sufficient Concept Explanations for Deep Vision Models

    Jun 5, 2026Arthur Hoarau, Chenrui Zhu, Vu Linh NguyenExplainable Artificial IntelligenceConcept-Based Explanations

  14. A Geometric View for Understanding Concept Learning and Neuron Interpretation in Sparse Autoencoders

    Jun 5, 2026Chenhao Zhang, Chris Lin, Su-In LeeSparse AutoencodersNeural Network Interpretability

  15. Modeling Nonlinear Feature Interactions with Product-Unit Residual Networks

    Jun 5, 2026Ziyuan Li, Uwe Jaekel, Babette DellenFeature Interaction ModelingNeural Network Interpretability

  16. Principles and Practice of Deep Representation Learning: or a Mathematical Theory of Memory

    Jun 4, 2026Sam Buchanan, Druv Pai, Peng Wang +1Deep Learning OptimizationRepresentation Learning

  17. Neuron Populations Exhibit Divergent Selectivity with Scale

    Jun 2, 2026Amil Dravid, Yasaman Bahri, Alexei A. Efros +1Neural Network InterpretabilityNeural Encoding

  18. Learning Coherent Representations: A Topological Approach to Interpretability

    Jun 1, 2026Sigurd Gaukstad, Melvin Vaupel, Valdemar Kargård Olsen +2Representation LearningNeural Representation Geometry

  19. Structure and Scale in Simplicial Sequence Modelling

    May 31, 2026Matthew Farrugia-RobertsRepresentation GeometryTransformer

  20. Normalized Relevance Measure as a Unifying Framework to Explain Neural Network Latent Structures

    May 30, 2026Ping Xiong, Thomas Schnake, Grégoire Montavon +2Feature AttributionNeural Network Interpretability

  21. Interpretability Without Tradeoffs: Disentangling Polysemanticity At Equal Predictive Performance

    May 29, 2026Doğukan Bağcı, Bernt Schiele, Simone Schaub-Meyer +2Disentangled Representation LearningRepresentation Disentanglement

  22. Interpreting FCDNNs via RG on Exponential Family

    May 29, 2026Fuzhou Gong, Zigeng XiaNeural Network InterpretabilityNeural Network Training Dynamics

  23. Challenges in Explaining Pretrained Clinical Text Classifiers

    May 27, 2026Kristian Miok, Matej Klemen, Blaz Škrlj +1Feature AttributionNeural Network Interpretability

  24. From Latent Space to Training Data: Explainable Specialization in Minimal MLPs

    May 25, 2026Enrique Alba, Ezequiel Lopez-RubioMultilayer PerceptronsNeural Network Interpretability

  25. Courant: a State-Adaptive Perceiver-Based Neural Surrogate with Local Support and Interpretable Field Decomposition

    May 24, 2026Anuj Kumar, Josiah Bjorgaard, Nikolaos Bouklas +2Neural Surrogate ModelingPDE Surrogate Modeling

  26. Rare Events, Real Signals: Functional Ensembles as Units of Computation in Deep Spiking Networks

    May 21, 2026Aditi Aravind, Konstantinos Ladakis, Mario Alexios Savaglio +2Functional ConnectivityNeural Network Interpretability