Transformer Interpretability

Latest papers 224

All topics
CardsList
  1. Fully Interpretable Minimal Transformers: From Geometry to Algorithm

    Oct 7, 2026Raneem Mahajne, Toviah MoldwinTransformer InterpretabilityMechanistic Interpretability

  2. A Comparative Explainability Framework for DeBERTa-v3 in Zero-Shot Medical Abstract Classification

    Oct 1, 2026Javier Diaz Esteban-Herreros, David Muñoz-Valero, Raquel Martínez-España +2Transformer InterpretabilityPerturbation-Based Feature Attribution

  3. Capturing In-Context Learning Dynamics with Task Operators

    Oct 1, 2026Guangzhi Xiong, Zhenghao He, Bohan Liu +3Transformer InterpretabilityIn-Context Learning

  4. Shared Weights, Selected Computations: How Looped Transformers Route What Each Loop Does

    Sep 30, 2026Jiaju Wu, Yi Hu, Muhan ZhangTransformer InterpretabilityTransformer Attention

  5. D-Scope: Decomposing and Steering Diffusion Transformers with Sparse Autoencoders

    Sep 30, 2026Xinyue Xu, Jiahao Zhang, Lijie Hu +2Transformer InterpretabilityDiffusion Transformer

  6. Concept Subspaces Compute Beyond the Logit Lens: A Weights-Only Test for Locating Representations Upstream of Readout

    Sep 30, 2026Aojie Yuan, Zhiyuan Julian Su, Haiyue Zhang +1Transformer InterpretabilityRepresentation Geometry in Language Models

  7. The Geometry of Inference in Transformer Residual Streams

    Sep 29, 2026Timur Mudarisov, Mikhail Burtsev, Radu StateTransformer InterpretabilityTransformer Inference

  8. Which the Eye Fears: Writing with Read-Blindness Explains Massive Activations in Transformers

    Sep 28, 2026Swagatam Mukhopadhyay, Vishal Vivek Saley, Vraj Parikh +1Transformer InterpretabilityTransformer FFNs

  9. Understanding Confabulation and Rethinking Reconstruction in Activation Explanations

    Sep 27, 2026Gert Lek, Zixuan Xia, Pin-Yu Chen +1Transformer InterpretabilityFaithfulness of Language Model Explanations

  10. Comparing Latent Concept Formation in State Space Models and Transformers via Sparse Autoencoders

    Sep 21, 2026Rithin Nagaraj, Rupa Laalasa Oruganti, Prerna Subhashchandra Kunder +1Transformer InterpretabilityLanguage Modeling

  11. Prescriptive SVD-Inspired Attention via Spectral Energy Retention

    Sep 21, 2026Vasileios Arampatzakis, Vasileios Sevetlidis, George PavlidisTransformer InterpretabilityLow-Rank Attention

  12. Deep Noir: Autonomous Steering Discovery via Architectural Chronometry in Transformer Models

    Sep 17, 2026Frank E. Bobe, Gregory D. Vetaw, Darshan W. Bryner +2Transformer InterpretabilityLanguage Model Steering

  13. Generalization through Lexical Abstraction in Transformer Models: The Case of Functional Words

    Sep 17, 2026Giuseppe Samo, Vivi Nastase, Paola MerloTransformer InterpretabilityWord Embeddings

  14. Weakening Neurons: An Input-Output Functionality in Transformers with Outsize Influence

    Sep 16, 2026Sebastian Gerstner, Hilal AlQuabeh, Kentaro Inui +1Transformer InterpretabilityTransformer FFNs

  15. ResLRP: The Role of Residual Cancellation in Attribution Instability in Vision Transformers

    Sep 15, 2026Jim Berend, Reduan Achtibat, Daniel Schäffer +4Transformer InterpretabilityResidual Learning

  16. What Does Layer-Importance Reveal About Transformers and State-Space Models?

    Sep 15, 2026Istabrak Abbes, Nizar Islah, Irina Rish +1Transformer InterpretabilitySelective SSMs

  17. Where Decoder Cosine Similarity Fails for SAE Feature Flow Discovery

    Sep 14, 2026Hendrik Droste, Christian Medeiros Adriano, Kathrin Korte +1Transformer InterpretabilitySparse Autoencoders

  18. Sparse Weight and Edge Circuit Discovery in Transformer-based Acoustic Models

    Sep 11, 2026Jiankun Wei, Ewan Dunbar, Gerald PennTransformer InterpretabilityCircuit Discovery

  19. Analyzing Traditional and Neural Approaches to Multilingual Readability Assessment

    Sep 11, 2026Joshua Wong, Chris TannerTransformer InterpretabilityFeature Attribution

  20. Quantifying Logical Consistency in Transformers via Query-Key Alignment

    Sep 10, 2026Eduard Tulchinskii, Anastasia Voznyuk, Laida Kushnareva +4Transformer InterpretabilityLLM Evaluation

  21. Training Trajectories Determine Circuit Removability in Annealable Soft-Prior Transformers

    Sep 9, 2026Zonglin Yang, Ziming Zhao, Wei Tang +5Transformer InterpretabilityAttention Mechanisms

  22. Through the Looking Glass: Directly Reading and Writing Transformers

    Sep 9, 2026Mark OskinKnowledge EditingTransformer Interpretability

  23. "World Knowledge" in the Weights: Reading Concept Circuits of Vision Transformers

    Sep 8, 2026Yanlin Chen, Tang Li, Xi PengTransformer InterpretabilityVision Foundation Models

  24. LLM Layers Immediately Correct Each Other

    Sep 7, 2026Arjun Patrawala, Jiahai Feng, Erik Jones +1Transformer InterpretabilityRepresentation Geometry in Language Models