LLM Interpretability

LLM: Large Language Model

Latest papers 546

All topics
CardsList
  1. SearchAtlas: Analyzing Agentic Search Strategies via Evidential Query Graphs

    Sep 11, 2026Jiacheng Sang, Mengyuan Li, Sanxing Chen +3Agentic SearchLLM Interpretability

  2. TEFM: Token-Efficient Faithful Modeling for Structured Data

    Sep 9, 2026Zhichao Hou, Lingdao Sha, Xueyu Mao +3LLM InterpretabilityTabular Classification

  3. Do Reasoning Representations Help Humans Evaluate LLM Outputs?

    Sep 8, 2026Jaewoo Lim, Sungbok Shin, Sanghyun HongLLM EvaluationLLM Interpretability

  4. Vision: Data-Centric Anchoring for Robust and Interpretable Agentic AI

    Sep 8, 2026Arun Vignesh Malarkkan, Xinyuan Wang, Yanjie FuAI Agent ReliabilityDistribution Shift

  5. From Echo Chambers to Epistemic Monoculture: Large Language Models Present Temporally Contingent Partisan Alignments as Knowledge

    Sep 7, 2026Wend K. TamLLM AlignmentLLM Interpretability

  6. The Internal Anatomy of Strategic Choice in Large Language Models

    Sep 7, 2026Vinícius Ferraz, Leon Houf, Enrico FerreaLLM InterpretabilityStrategic Reasoning Risks in Language Models

  7. Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning

    Sep 3, 2026Kevin Du, Alexander Hoyle, Laura Ruis +1CoT FaithfulnessProcess Reward Models

  8. A Circuit for Plural Reference: How LLMs Represent and Retrieve Singular and Plural Entities

    Sep 3, 2026Anh Danh, Rick Nouwen, Massimo PoesioCoreference ResolutionLLM Interpretability

  9. Large Language Models in Resolving Contextual Knowledge Conflicts

    Sep 2, 2026Xinye Yang, Zhenyang Liu, Ruisi Li +1Knowledge Conflicts in Language ModelsLLM Interpretability

  10. Sparse Readout Prism: Explaining Logit-Lens Scores in Features Instead of Tokens

    Sep 1, 2026Matteo He, William F. Shen, Xinchi Qiu +1Transformer InterpretabilityLLM Interpretability

  11. StateSwap: Probing Support-Elimination Hidden States in Multiple-Choice Questions

    Sep 1, 2026Chao Gao, Haijiang Liu, Qiyuan Li +3Prompt SensitivityMultiple-Choice Question Answering

  12. A Unified Mechanistic Analysis of Knowledge- and Safety-Based Refusals

    Sep 1, 2026Yuri Son, Seunghee Kim, Hyuhng Joon Kim +1LLM InterpretabilityLLM Refusal Behavior

  13. S^3martCirc: Self-supervised Smart Circuit Discovery

    Sep 1, 2026Wendy Zheng, Yinhan He, Liang Wu +1LLM InterpretabilityMechanistic Interpretability

  14. How Do Language Models Choose Between Context and Memory?

    Sep 1, 2026Benjamin Shih, John Winnicki, Arianna CaoKnowledge Conflicts in Language ModelsLLM Interpretability

  15. CRAFT: Fine-Tuning Pre-hoc Explainability in AI-native 6G RAN

    Sep 1, 2026Pranshav Gajjar, Vijay K Shah6G NetworksLLM Interpretability

  16. Latent Mechanisms of Language Control in Multilingual Language Models

    Aug 31, 2026Ryo Mitsuhashi, Sabri Boughorbel, Majd HawaslyMultilingual Language ModelsMultilingual Language Model Evaluation

  17. Verbalizing Multi-Token Concepts in LLMs

    Aug 31, 2026Xijie Gong, Zimeng Huang, Tonghan WangLLM Interpretability

  18. MURANO: Design, Run, and Reproduce Mechanistic Interpretability Experiments as Composable Pipelines

    Aug 31, 2026Alireza Bayat Makou, Emirhan Böge, Phu Gia Hoang +5LLM InterpretabilityInterpretable ML

  19. Detecting Hidden Chain-of-Thought in Large Language Models with Linguistic, Behavioral, and Mechanistic Indicators

    Aug 30, 2026Armaan Singh, Ryan Trinh Le, Jasmine Kaur +5LLM EvaluationLLM Interpretability

  20. When Personality Meets Quantization: A Layer-wise MBTI Analysis of Quantized LLMs

    Aug 26, 2026Yao Fu, Lijia Huang, Xiaomin Li +3LLM QuantizationLLM Interpretability

  21. RACE: Scalable Statistical Estimation of Functional Consistency in LLM Neurons

    Aug 25, 2026Runyu Wang, Bo Liu, Xiaxin Zhang +6Transformer InterpretabilityLLM Interpretability

  22. Hidden in the Request: Explaining Unethical LLM Compliance through Token Relevance

    Aug 24, 2026Or Biton, Tomer Krichli, Itai Allouche +1Language Model DecodingLanguage Model Safety Evaluation

  23. LITERARYBIGFIVE: Author-Personalized Text Generation in a Unified Interpretable Space

    Aug 24, 2026Jinghui Zhang, Lang Gao, Ao Li +5Language Model SteeringLLM Interpretability

  24. J-Miner: Recovering the Decision Logic of Fine-Tuned LLM Classifiers as Compact Rules

    Aug 17, 2026Yunfan Gao, Xinyi Huang, Tao Sheng +3LLM InterpretabilityInterpretable ML

  25. SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization

    Aug 13, 2026Weihan Meng, Hongzhu Guo, Yi Jing +5LLM InterpretabilitySparse Autoencoders