LLM Interpretability

LLM: Large Language Model

Latest papers 546

All topics
CardsList
  1. Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations

    Jul 30, 2026Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña LópezLLM PruningLLM Interpretability

  2. RepBench: Compiling Benchmarks into Capability Representations for Large Language Models

    Jul 30, 2026Yanshi Li, Xueru Bai, Shuman Liu +1LLM EvaluationLLM Interpretability

  3. Reasoning Consensus: Structural Ensembling of LLM Reasoning via Weighted DAG Aggregation

    Jul 30, 2026Amruta Parulekar, Jinu Lee, Dilek Hakkani-Tür +1LLM Reasoning with GraphsLLM Interpretability

  4. Hidden APIs in Language Models: Discovering Reusable Causal Interfaces from Forked Futures

    Jul 30, 2026SiYuan Ma, Yiqin Luo, Zhangji +8LLM InterpretabilityCausal Abstraction

  5. From Representations to Behaviors: Exploring the Person-Situation-Behavior Triad in LLMs

    Jul 29, 2026Ruikang Zhang, Shuo Wang, Qi SuLLM InterpretabilityPersonality Modeling in Language Models

  6. Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models

    Jul 28, 2026Antyabha Rahman, Akshaj Gurugubelli, Omar Ankit +2Numerical Reasoning in Language ModelsLLM Interpretability

  7. How Do LLMs Read Bug Reports? An Empirical Study of Attention in LLMs for Automated Program Repair

    Jul 28, 2026Ramtin Ehsani, Irene Manotas, Saurabh Pujar +2Automated Program RepairLLM Interpretability

  8. LLMs Can Annotate Attribution Graphs

    Jul 28, 2026Ameen Patel, Max Zhang, Nathan HuLLM InterpretabilityLLM-Assisted Annotation

  9. How Context Attribution Handles What the Model Already Knows

    Jul 26, 2026Quoc-Huy Trinh, Lin Zhu, Sebastian SzyllerLLM EvaluationLLM Interpretability

  10. Do LLMs Know Their Vulnerable Scenarios?

    Jul 26, 2026Ziheng Peng, Huiqi Deng, Haoran Jing +5LLM InterpretabilityAdversarial Scenario Generation

  11. Not All LLM Reasoning is Visible in the Chain-of-Thought

    Jul 24, 2026Vatsal Baherwani, Tom Goldstein, Ashwinee PandaCoT FaithfulnessLLM Interpretability

  12. When Language Models Meet NeuroGraphs: Exploring Enhanced Agentic LLM Framework Towards Brain Network Analysis

    Jul 24, 2026Jiaxing Li, Rui Dong, Muyao Tang +1LLM InterpretabilityLLM Agents

  13. Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders

    Jul 23, 2026Pablo Santiago Potes Velasco, María del Mar García Matabanchoy, Óscar Julián Pérez Ladino +3LLM InterpretabilityCultural Bias in Language Models

  14. Training Large Language Models for Self-Explanation Faithfulness

    Jul 23, 2026Yeoktatt Cheah, María Pérez-Ortiz, Noah Y. Siegel +1Faithfulness of Language Model ExplanationsLLM Interpretability

  15. Where Animacy Lives in Large Language Models: Tracing the Circuits of the Animacy Concept

    Jul 23, 2026Samuele Punzo, Giovanni Cinà, Sandro PezzelleLLM InterpretabilityCircuits in Language Models

  16. Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects

    Jul 22, 2026Seonglae Cho, Zekun Wu, Kleyton Da Costa +3LLM InterpretabilitySparse Autoencoders

  17. Gotta Catch them all: the modes of Sycophancy

    Jul 22, 2026Shreyans Jain, Alexandra Yost, Amirali AbdullahLLM SycophancyLLM Interpretability

  18. Understanding the Impact of Linguistic Realization Choices on LLM Stance with Causal Tracing

    Jul 22, 2026Langchen Huang, Sebastian Padó, Franziska WeeberPrompt SensitivityLLM Interpretability

  19. Diagnosing Correctness Probes under Self-Judgement Confounding

    Jul 18, 2026Yi-Long LuLLM InterpretabilityLanguage Model Self-Assessment

  20. Are Arithmetic Heuristic Neurons Form-Invariant? A Mechanistic Analysis of Symbols, Text, and Code in LLMs

    Jul 18, 2026Sharath Naganna, Tanvir Ahmed Sijan, Uddipta KalitaLLM InterpretabilityCircuits in Language Models