LLM Interpretability

LLM: Large Language Model

Latest papers 546

All topics
CardsList
  1. DMDIntel: Interpreting Large Language Models via Dynamic Mode Decomposition

    Aug 13, 2026Amogh Joshi, Animesh Mukherjee, Sergey UtyuzhnikovFeature AttributionLLM Interpretability

  2. Perturbation-based Regional Interpretability through Subtraction Mapping (PRISM): naming-error dissociations in language models and post-stroke aphasia

    Aug 13, 2026Xiang Guan, Roger D. Newman-Norlund, Yong Yang +8Transformer InterpretabilityLLM Interpretability

  3. Locating and Controlling Implicit Personalization in Large Language Models

    Aug 12, 2026Yueru Yan, Siqi Wu, Thai LeLLM PersonalizationLLM Interpretability

  4. Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

    Aug 12, 2026Mingyu Zong, Sampad Mohanty, Bhaskar KrishnamachariLLM AlignmentLLM Interpretability

  5. Conflict and Congruency Effects in Large Language Models: In-Weight and In-Context Competition in a Verbal Conflict Task

    Aug 11, 2026Xiaoyang Hu, Mike Angstadt, Shane Storks +5Knowledge Conflicts in Language ModelsLLM Interpretability

  6. Beyond a Bag of Features: Set-Level Instability in Sparse Autoencoders

    Aug 11, 2026Nikolai Bolik, Lennart Stöpler, Artur AndrzejakRepresentation LearningLLM Interpretability

  7. From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop

    Aug 11, 2026Rahul Gupta, Abhinav Mohanty, Anaelia Ovalle +10LLM InterpretabilityLLM Safety Alignment

  8. Chemically Meaningful Textualization Enables Explainable Validation of Metal-Organic Frameworks by Large Language Models

    Aug 11, 2026Guobin Zhao, Xiao-Yan LiLLM EvaluationLLM Interpretability

  9. Interpreting Language Model Hidden States at Scale

    Aug 10, 2026Jordan Pettyjohn, Mansi Sakarvadia, Nathaniel Hudson +3LLM InterpretabilityMechanistic Interpretability

  10. Decodable But Not Detachable: Training Data Granularity Determines Parametric Modularity in Large Language Models

    Aug 10, 2026Marcus Armstrong, Navid Ayoobi, Arjun MukherjeeLLM InterpretabilityCircuits in Language Models

  11. Thinking vs. NoThinking: Towards Interpreting Reasoning Mechanisms of Large Language Models via Sparse Autoencoders

    Aug 8, 2026Bo Cheng, Qiaolin Lu, Yi Chang +1LLM InterpretabilityCoT Reasoning

  12. Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk

    Aug 8, 2026Gregorius Reynaldi Pratama, Kuo-Kun TsengFeature AttributionFaithfulness of Language Model Explanations

  13. Measuring Concept Content in Text from LLM Activations: ESG Evidence from Concept Vectors and Linear Probes

    Aug 7, 2026Luc Hazenoot, Zhaochun Ren, Amirhossein ZohrehvandLinear ProbingLLM Interpretability

  14. Reasoning Errors Have a Region and a Direction in the Residual-Stream Trajectory of LLMs

    Aug 6, 2026Hamed Damirchi, Ignacio Meza De la Jara, Damith Ranasinghe +2Language Model Error DetectionLLM Interpretability

  15. Scaling Inherently Interpretable Language Models

    Aug 6, 2026Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail +7Language Model SteeringLLM Interpretability

  16. Recovering Lesion Parameters from Aphasic Picture Naming Error Profiles in Large Language Models

    Aug 5, 2026Yong Yang, Roger Newman-Norlund, Xiang Guan +10LLM InterpretabilityCausal Interventions in Language Models

  17. Attention is Case-Sensitive

    Aug 4, 2026Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso +1LLM InterpretabilityVLM Interpretability

  18. Activation-Guided Neuron Intervention to Induce Alzheimer's-Related Computational Language Phenotypes in a Large Language Model

    Aug 4, 2026Rui He, Ercong Nie, Hong Jiang +3Alzheimer's DiseaseLLM Interpretability

  19. Interpreting Black-Box Large Language Models with Sentence-Level Energy Landscapes

    Aug 3, 2026Maryam Rezaee, Pooriya Safaei, Maryam Asgarinezhad +1Surrogate ModelingLLM Interpretability

  20. GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning

    Aug 3, 2026Zhaoxin Yu, Qi Shen, Hengli Li +4Test-Time OptimizationLLM Interpretability

  21. Cultural Awareness is Represented but Not Decoded: Tracing Mythological Knowledge across 18 Open-Source LLMs

    Aug 3, 2026Iaroslav Chelombitko, Ekaterina Chelombitko, Mika HämäläinenMultilingual Language ModelsLLM Interpretability

  22. How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models

    Aug 3, 2026Andres Algaba, Francesca Carlon, Lynn Delcon +3LLM EvaluationLLM Interpretability

  23. Token-Level Diagnosis of Sycophancy in LLMs with Attribution-Guided Steering

    Jul 31, 2026Hieu Nguyen, Mahammed Kamruzzaman, Anshuman Chhabra +1LLM SycophancyLLM Interpretability

  24. Metaphor Tracer: A Theory-Informed Analysis of Hidden States

    Jul 30, 2026Marc Heimann, Roxana Assadi Moghaddam, Olga Brovkina +2LLM InterpretabilityRepresentation Geometry in Language Models