Interpretability

Latest papers 309

All topics
CardsList
  1. Interpretability and Generalization Bounds for Learning Spatial Physics

    Jun 18, 2025Alejandro Francisco Queiruga, Theo Gutman-Solo, Shuai JiangPhysics-Informed LearningGeneralization Bounds

  2. InverseScope: Scalable Activation Inversion for Interpreting Large Language Models

    Jun 9, 2025Yifan Luo, Zhennan Zhou, Bin DongModel ActivationsInterpretability

  3. Tensorization is a powerful but underexplored tool for compression and interpretability of neural networks

    May 26, 2025Safa Hamreras, Sukhbinder Singh, Román OrúsTensor NetworksNeural Network

  4. Bayesian Deep Learning for Discrete Choice

    May 23, 2025Daniel F. Villarraga, Ricardo A. DazianoDiscrete Choice ModelsBayesian Neural Networks

  5. Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models

    Mar 8, 2025Thomas Winninger, Boussad Addad, Katarzyna KapustaMechanistic InterpretabilityBlack Box

  6. Compositional Concept-Based Neuron-Level Interpretability for Deep Reinforcement Learning

    Feb 2, 2025Zeyu Jiang, Hai Huang, Xingquan ZuoInterpretabilityNeurons

  7. Interpretable Clustering: A Survey

    Sep 1, 2024Lianyu Hu, Mudi Jiang, Junjie Dong +2ClusteringInterpretability

  8. SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?

    Date pendingYuqiao Tan, Shizhu He, Jun Zhao +1Artificial Intelligence AgentsAgentic Discovery