Transformer Interpretability

Latest papers 224

All topics
CardsList
  1. Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe

    May 1, 2026Gaofei Shen, Martijn Bentum, Tomas O. Lentz +2Transformer InterpretabilityRepresentation Probing

  2. AttriBE: Quantifying Attribute Expressivity in Body Embeddings for Recognition and Identification

    Apr 29, 2026Basudha Pal, Siyuan Huang, Anirudh Nanduri +2Transformer InterpretabilityRepresentation Probing

  3. Efficient and Interpretable Transformer for Counterfactual Fairness

    Apr 29, 2026Panyi Dong, Zhiyu QuanTransformer InterpretabilityTransformer

  4. Rank, Head-Channel Non-Identifiability, and Symmetry Breaking: A Precise Analysis of Representational Collapse in Transformers

    Apr 26, 2026Giansalvo CirrincioneTransformer InterpretabilityRepresentation Collapse

  5. Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers

    Apr 26, 2026Audrey Cherilyn, Houman SafaaiTransformer InterpretabilityLLM Pruning

  6. When Chain-of-Thought Fails, the Solution Hides in the Hidden States

    Apr 25, 2026Houman Mehrafarin, Amit Parekh, Ioannis KonstasTransformer InterpretabilityCoT Reasoning

  7. Real-Time AttentionBender: Granular Interactive Network Bending of Video Diffusion Transformers

    Apr 24, 2026Adam Cole, Rebecca Fiebrink, Mick GriersonTransformer InterpretabilityVideo Diffusion Models

  8. Dissociating Decodability and Causal Use in Bracket-Sequence Transformers

    Apr 24, 2026Aryan Sharma, Cutter Dawes, Shivam RavalTransformer InterpretabilitySelf-Attention

  9. Evaluating Post-hoc Explanations of the Transformer-based Genome Language Model DNABERT-2

    Apr 23, 2026Isabel Kurth, Paulo Yanez Sarmiento, Bernhard Y. RenardTransformer InterpretabilityAttention Mechanisms

  10. Decision-Aware Attention Propagation for Vision Transformer Explainability

    Apr 20, 2026Sehyeong Jo, Gangjae Jang, Haesol ParkTransformer InterpretabilityVision Transformer

  11. One Mask to Rule Them All: On Hidden Facts after Editing and How to Find Them

    Apr 18, 2026Ali Holmov, Paul Youssef, Nandi Schoots +1Knowledge EditingTransformer Interpretability

  12. Structural Instability of Feature Composition

    Apr 18, 2026Yunpeng ZhouFeature SuperpositionTransformer Interpretability

  13. Towards Intrinsic Interpretability of Large Language Models:A Survey of Design Principles and Architectures

    Apr 17, 2026Yutong Gao, Qinglin Meng, Yuan Zhou +1Transformer InterpretabilityLLM Interpretability

  14. Hallucination as Trajectory Commitment: Causal Evidence for Asymmetric Attractor Dynamics in Transformer Generation

    Apr 16, 2026G. Aytug AkarlarTransformer InterpretabilityHallucination in Language Models

  15. From Dispersion to Attraction: Spectral Dynamics of Hallucination Across Whisper Model Scales

    Mar 31, 2026Ivan Viakhirev, Kirill Borodin, Grach MkrtchianTransformer InterpretabilityAutomatic Speech Recognition

  16. Dual Path Attribution: Efficient Attribution for SwiGLU-Transformers through Layer-Wise Target Propagation

    Mar 20, 2026Lasse Marten Jantsch, Dong-Jae Koh, Seonghyeon Lee +1Transformer InterpretabilityLLM Interpretability

  17. Feature-level Interaction Explanations in Multimodal Transformers

    Mar 4, 2026Yeji Kim, Housam Khalifa Bashier Babiker, Mi-Young Kim +1Transformer InterpretabilityFeature Attribution

  18. MetaOthello: A Controlled Study of Multiple World Models in Transformers

    Feb 26, 2026Aviral Chawla, Galen Hall, Juniper LovatoTransformer InterpretabilityWorld Model Learning

  19. Patches of Nonlinearity: Instruction Vectors in Large Language Models

    Feb 8, 2026Irina Bigoulaeva, Jonas Rohweder, Subhabrata Dutta +1Transformer InterpretabilityLLM Interpretability