Transformer Interpretability

Latest papers 224

All topics
CardsList
  1. Encoded Early, Used Late: Where Transformers Begin to Act on an Inferred Partner's Expertise

    Sep 7, 2026Mika Okamoto, Gabriele SartiTransformer InterpretabilityLanguage Model Probing

  2. Sparse Readout Prism: Explaining Logit-Lens Scores in Features Instead of Tokens

    Sep 1, 2026Matteo He, William F. Shen, Xinchi Qiu +1Transformer InterpretabilityLLM Interpretability

  3. HiLRP: Toward One Trustworthy Explanation for Vision Transformer: Conservation-Valid Attribution via Attention Primitives

    Sep 1, 2026Sathiyamohan Nishankar, Pubudu Sanjeewani, Asanka Perera +1Transformer InterpretabilityVision Transformer

  4. Late Transformer Layers Recode Syntax Canonically: Evidence from Greek Scrambling and Cross-Layer Generalisation

    Aug 31, 2026Christos Nikolaos Zacharopoulos, Revekka Kyriakoglou, Chara Tsoukala +1Transformer InterpretabilityLanguage Modeling

  5. RACE: Scalable Statistical Estimation of Functional Consistency in LLM Neurons

    Aug 25, 2026Runyu Wang, Bo Liu, Xiaxin Zhang +6Transformer InterpretabilityLLM Interpretability

  6. Perturbation-based Regional Interpretability through Subtraction Mapping (PRISM): naming-error dissociations in language models and post-stroke aphasia

    Aug 13, 2026Xiang Guan, Roger D. Newman-Norlund, Yong Yang +8Transformer InterpretabilityLLM Interpretability

  7. Class Activation Mapping in Explainable Computer Vision: A Method-Centered Review of CNN, Transformer, and Foundation-Model-Era Visual Explanations

    Aug 12, 2026AmirHossein Eshghi, Hamid Saadatfar, Seyyed Ali Hoseini +2Transformer InterpretabilityFeature Attribution

  8. Off-Axis, On Purpose: Where a Transformer Computes Concepts and Why it Does So

    Aug 10, 2026Mark OskinTransformer InterpretabilityTransformer Attention

  9. Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention

    Aug 8, 2026Kasun Dewage, Marianna Pensky, Suranadi De Silva +1Transformer InterpretabilityTransformer Attention

  10. Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

    Aug 7, 2026Zili Zhang, Yilin Wang, Heng Wang +2Transformer InterpretabilityOOD Generalization

  11. Transformer Geometry Observatory TGO-IV: Developmental Topology Observatory

    Aug 7, 2026Kaustubh Kapil, Kishor P. UplaTransformer InterpretabilityNeural Representation Geometry

  12. Beyond Attention: Signed Integrated Gradients Attribution in a BiomeGPT-Style Microbiome Transformer

    Aug 6, 2026Oren NelsonGradient-Based AttributionIntegrated Gradients

  13. IRIS: A Visual Cortex-Inspired Framework for Analyzing Orientation Selectivity in Vision Transformers

    Aug 5, 2026Vaishnavi B Mohan, Vijayakrishna Naganoor, Yashas Annadani +1Transformer InterpretabilityVisual Representation Learning

  14. Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI

    Aug 5, 2026Casey Wall, Longwei Wang, Rodrigue Rizk +1Gradient-Based AttributionTransformer Interpretability

  15. Sparse Weight Decomposition for Efficient Circuit Extraction

    Aug 4, 2026Chuanhao Yan, Xuhan Huang, Yawen Duan +4Transformer InterpretabilityMechanistic Interpretability

  16. Probing Character-level Transformers for the Spanish L-shaped Morphome

    Aug 4, 2026Akhilesh Kakolu Ramarao, Kevin Tang, Wiebke Petersen +1Transformer InterpretabilityTransformer

  17. Does Explainability Transfer? A Controlled Benchmark of Attribution Methods on Vision Transformers and CNNs

    Aug 3, 2026Sathiyamohan Nishankar, Nethmi Pathirana, Pubudu Sanjeewani +2Transformer InterpretabilityFeature Attribution

  18. Feed-Forward Steering in Transformer Residual Dynamics

    Aug 3, 2026Timur Mudarisov, Mikhail Burtsev, Radu StateTransformer InterpretabilityTransformer FFNs

  19. Transformer Geometry Observatory TGO-III: Semantic Geometry Observatory

    Aug 3, 2026Kaustubh Kapil, Kishor P. UplaTransformer InterpretabilityNeural Representation Geometry

  20. Divergent large language model predictions from convergent representations in ambiguous word pairs

    Aug 3, 2026K. Jack Scott, Narun Pat, Veronica LiesaputraTransformer InterpretabilityDecoder-Only Language Models

  21. Interpretability-Guided Soft Pruning of Attention Heads in Vision Transformers

    Jul 31, 2026Kamil Książek, Piotr Suszyński, Michał Jan Włodarczyk +2Transformer InterpretabilityAttention Head Analysis

  22. Emergent Latent-State Computation under Stochastic Volatility

    Jul 28, 2026Xiaoyu Huang, Lulu WangTransformer InterpretabilityMechanistic Interpretability

  23. Interpretable GOHR Agents via Sparse Autoencoders

    Jul 27, 2026Shiwei Tan, Yusong Zhao, Weiyi Qin +6Transformer InterpretabilitySparse Autoencoders