LLM Interpretability

LLM: Large Language Model

Latest papers 546

All topics
CardsList
  1. Skin-Deep: A Geometric Diagnostic for Alignment Fragility in Large Language Model Representations

    Jun 21, 2026Dongyub Jude Lee, Jungseob Lee, Seungyoon Lee +5LLM InterpretabilityLLM Fine-Tuning

  2. Agent MechSuits: Mechanistic Subspace Safety Steering for Multi-Turn CLI Agents

    Jun 21, 2026Weidi Luo, Qiming Zhang, Yihao Quan +5Computer-Use AgentsLLM Interpretability

  3. Interleaved Speech Language Models Latently Work In Text

    Jun 21, 2026Talia Sternberg, Gallil Maimon, Yossi AdiLLM InterpretabilitySpeech Language Models

  4. First-Token Broadcasters: Mechanistic Origins of Language Identity and Distributed Robustness in Transformers

    Jun 21, 2026Arjun Pillai, Christian Hoang, Anjelo Jann LarozaMultilingual Language ModelsLLM Interpretability

  5. Interpreting Latent CoT Reasoning as Dynamical Systems

    Jun 20, 2026Sabari Iyyappan Duraipandian, Shreya Sanjay Boyane, Manju Nagesh +3Latent Dynamics ModelingLLM Interpretability

  6. Local Causal Attribution of Chain-of-Thought Reasoning

    Jun 20, 2026Dennis Wei, Yannis Belkhiter, Erik Miehling +1LLM InterpretabilityCausal Attribution

  7. Decodable but Not Faithful: Coupling Natural-Language Rationales to Programmatic Verifiers

    Jun 19, 2026Vatsal Ananthula, Adarsh KumarappanFaithfulness of Language Model ExplanationsLLM Auditing

  8. Behavioral and Representational Evidence of Binomial Ordering Preferences in Large Language Models

    Jun 19, 2026Zhiqing Yang, Yilun Liu, Yunpu Ma +2Multilingual Language Model EvaluationLLM Interpretability

  9. Factual Retrieval in LLMs Is a Redundant, Distributed and Non-Contiguous Process

    Jun 19, 2026Hail Hochman, Natalie Shapira, Yoav GoldbergLLM InterpretabilityFactual Knowledge in Language Models

  10. A Multi-Agent Audit Framework for High-Stakes Reasoning: Evaluation and Interpretability in Clinical Mental Health Screening

    Jun 19, 2026Jingchen Ye, Yanpei Yu, Luyao ZhangLLM AuditingLLM Interpretability

  11. A Validation-Gated Mechanistic Account of Suicidality Detection in LLMs

    Jun 19, 2026Nafiz Ahmed, Sarah Sharif, Dingjing Shi +1LLM InterpretabilityMental Health

  12. What Shapes Emergent Misalignment? Insights from Training Dynamics, Model Priors, and Data

    Jun 18, 2026Yuchen Zhang, Anietta Weckauff, Diego Garcia-Olano +1LLM EvaluationLLM Alignment

  13. How Transparent is DiffusionGemma?

    Jun 18, 2026Joshua Engels, Callum McDougall, Bilal Chughtai +11LLM InterpretabilityDiffusion Language Models

  14. From Texts to Scores: Tracing the Emergence of Essay Quality Representations in Large Language Models

    Jun 18, 2026Jiaxu Zuo, Mu You, Kaixin Lan +5LLM InterpretabilityAutomated Essay Scoring

  15. Explaining Attention with Program Synthesis

    Jun 17, 2026Amiri Hayes, Belinda Z Li, Jacob AndreasTransformer InterpretabilityAttention Head Analysis

  16. LLM Parameters for Math Across Languages: Shared or Separate?

    Jun 16, 2026Behzad Shomali, Luisa Victor, Tim Selbach +5Multilingual Language ModelsCross-Lingual Reasoning in Language Models

  17. From Sparse Features to Trustworthy Proxies: Certifying SAE-Based Interpretability

    Jun 16, 2026Dibyanayan Bandyopadhyay, Asif EkbalLLM InterpretabilitySparse Autoencoders

  18. From Brewing to Resolution: Tracing the Internal Lifecycle of Code Reasoning in LLMs

    Jun 16, 2026Siyue Chen, Yifu Guo, Yuquan Lu +9LLM InterpretabilityCode Language Models

  19. Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing

    Jun 16, 2026Kexin Chen, Yi Liu, Haonan Zhang +3LLM AuditingLLM Interpretability

  20. Scalable Circuit Learning for Interpreting Large Language Models

    Jun 15, 2026Naiyu Yin, Dennis Wei, Tian Gao +3Circuit DiscoveryLLM Interpretability

  21. Demystifying Variance in Circuit Discovery of LLMs

    Jun 15, 2026Frank Zhengqing Wu, Francesco Tonin, Volkan CevherPrompt SensitivityCircuit Discovery

  22. A Mechanistic Understanding of Pronoun Fidelity in LLMs

    Jun 15, 2026Katharina Trinley, Jesujoba O. Alabi, Dietrich Klakow +1Social Bias in Language ModelsLLM Interpretability

  23. Neuron Level Analysis of Large Language Model in Legal Domain Reasoning

    Jun 14, 2026Eri Onami, Youmi Ma, Shuhei Kurita +1Legal NLPLLM Interpretability

  24. The Truth Stays in the Family: Enhancing Contextual Grounding via Inherited Truthful Heads in Model Lineages

    Jun 14, 2026Miso Choi, Seonga Choi, Mincheol Kwon +3LLM GroundingLLM Interpretability

  25. Vernier: Probing Representational Misalignment Behind Lexical Gaps in Causal Reasoning

    Jun 14, 2026Zhenyu YuLLM InterpretabilityCausal Reasoning in Language Models

  26. Frame-Conditioned Moral Computation in LLaMA 3.1-8B-Instruct: A Mechanistic Interpretability Audit of Ethical Reasoning

    Jun 13, 2026Ali Dasdan, Manan Shah, W. Russell Neuman +3LLM AlignmentMoral Reasoning in Language Models