LLM Interpretability

LLM: Large Language Model

Latest papers 546

All topics
CardsList
  1. Exploitation Without Deception: Dark Triad Feature Steering Reveals Separable Antisocial Circuits in Language Models

    May 10, 2026Cameron Berg, Roshni LullaLLM InterpretabilityPersonality Modeling in Language Models

  2. Hidden Error Awareness in Chain-of-Thought Reasoning: The Signal Is Diagnostic, Not Causal

    May 10, 2026Aojie Yuan, Zhiyuan Julian Su, Haiyue Zhang +2LLM InterpretabilityCausal Interventions in Language Models

  3. How LLMs Are Persuaded: A Few Attention Heads, Rerouted

    May 10, 2026Xiangkun Sun, Lingkai Kong, Aoqi Zhang +2Self-AttentionLLM Interpretability

  4. Towards Effective Theory of LLMs: A Representation Learning Approach

    May 10, 2026Muhammed Ustaomeroglu, Guannan QuLLM InterpretabilityMechanistic Interpretability

  5. SMIXAE: Towards Unsupervised Manifold Discovery in Language Models

    May 9, 2026Collin FrancelAutoencodersLLM Interpretability

  6. The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations

    May 9, 2026Rania Elbadry, Ahmed Heakl, Fan Zhang +4LLM InterpretabilityLLM Reliability

  7. Do LLMs Experience an Internal Polylogue? Investigating Reasoning through the Lens of Personas

    May 9, 2026Nils A. Herrmann, Leander Girrbach, Kirill Bykov +1Language Model SteeringLLM Interpretability

  8. Data-driven Circuit Discovery for Interpretability of Language Models

    May 9, 2026Daking Rai, Mor Geva, Ziyu YaoCircuit DiscoveryLLM Interpretability

  9. A Geometric Perspective on Next-Token Prediction in Large Language Models: Three Emerging Phases

    May 9, 2026Gianfranco Lombardo, Giuseppe Trimigno, Stefano CagnoniNeural Representation GeometryLLM Interpretability

  10. Decomposing and Steering Functional Metacognition in Large Language Models

    May 9, 2026Yanshi Li, Xueru Bai, Shuman Liu +2LLM EvaluationLLM Interpretability

  11. Bilinear autoencoders find interpretable manifolds

    May 9, 2026Thomas Dooms, Ward Gauderis, Geraint Wiggins +1Neural Representation GeometryAutoencoders

  12. Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off

    May 9, 2026Yu Chen, Yuanhao Liu, Qi CaoLLM AlignmentLanguage Model Steering

  13. Mechanistic Analysis of Alignment Algorithms in Language Models

    May 9, 2026Aarush Sinha, Ishan Garg, Veeraraju Elluru +2LLM InterpretabilityMechanistic Interpretability

  14. A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models

    May 8, 2026Hamid Kazemi, Atoosa Chegini, Maria SafiLLM InterpretabilityAdversarial Attacks on LLMs

  15. A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models

    May 8, 2026Zeru Shi, Zhenting Wang, Fan Yang +2LLM InterpretabilityAttention Sinks

  16. Understanding Performance Collapse in Layer-Pruned Large Language Models via Decision Representation Transitions

    May 8, 2026Boyu Shi, Chang Liu, ChuanBao Gao +2LLM PruningLLM Interpretability

  17. Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning

    May 7, 2026Sixing Chen, Ji-An Li, Saner Cakir +3LLM PlanningLLM Interpretability

  18. Crafting Reversible SFT Behaviors in Large Language Models

    May 7, 2026Yuping Lin, Pengfei He, Yue Xing +5Supervised Fine-TuningLanguage Model Steering

  19. Features have life history. And we should care

    May 7, 2026Philipp Stecher, Sandro Radovanović, Vlasta Sikimić +1Representation LearningLLM Interpretability

  20. Eliciting associations between clinical variables from LLMs via comparison questions across populations

    May 7, 2026Fabian Kabus, Kian Kordtomeikel, Thomas Brox +3LLM InterpretabilityCausal Structure Learning

  21. The Granularity Axis: A Micro-to-Macro Latent Direction for Social Roles in Language Models

    May 7, 2026Chonghan Qin, Xiachong Feng, Ziyun Song +3LLM InterpretabilityLanguage Model Probing

  22. Navigating by Old Maps: The Pitfalls of Static Mechanistic Localization in LLM Post-Training

    May 7, 2026Hang Chen, Jiaying Zhu, Hongyang Chen +3Supervised Fine-TuningTransformer Interpretability

  23. When Does a Language Model Commit? A Finite-Answer Theory of Pre-Verbalization Commitment

    May 7, 2026Long Zhang, Wei-neng Chen, Feng-feng Wei +1LLM InterpretabilityLanguage Model Probing

  24. HyperLens: Quantifying Cognitive Effort in LLMs with Fine-grained Confidence Trajectory

    May 7, 2026Chengda Lu, Xiaoyu Fan, Wei XuConfidence Estimation in Language ModelsLLM Interpretability