Circuits in Language Models

Latest papers 69

All topics
CardsList
  1. LLMs Can Annotate Attribution Graphs

    Jul 28, 2026Ameen Patel, Max Zhang, Nathan HuLLM InterpretabilityLLM-Assisted Annotation

  2. Where Animacy Lives in Large Language Models: Tracing the Circuits of the Animacy Concept

    Jul 23, 2026Samuele Punzo, Giovanni Cinà, Sandro PezzelleLLM InterpretabilityCircuits in Language Models

  3. Circuit Claims Depend on What Is Extracted and How It Is Compared

    Jul 21, 2026Yang Sheng, Jie FuTransformer InterpretabilityCircuit Discovery

  4. Are Arithmetic Heuristic Neurons Form-Invariant? A Mechanistic Analysis of Symbols, Text, and Code in LLMs

    Jul 18, 2026Sharath Naganna, Tanvir Ahmed Sijan, Uddipta KalitaLLM InterpretabilityCircuits in Language Models

  5. Induction in Both Directions: A Mechanistic Analysis of In-Context Learning in Masked Diffusion Language Models

    Jul 17, 2026Andy Catruna, Emilian RadoiMasked Diffusion ModelsIn-Context Learning

  6. Transcoders for Investigating Deception in Language Models

    Jul 16, 2026Darius Lim, Nathan Leow, Xin Wei ChiaDeception in Language ModelsCircuits in Language Models

  7. A Shared Subcircuit Lets LLMs Count Down Across Tasks

    Jul 14, 2026Jacob Dunefsky, Wes Gurnee, Emmanuel AmeisenCircuit DiscoveryCircuits in Language Models

  8. Invariant Learning Dynamics of Transformers in Inductive Reasoning Tasks

    Jul 13, 2026Tiberiu Musat, Tiago Pimentel, Nicolas Zucchet +1In-Context LearningCircuits in Language Models

  9. Belief-reality separation lives in routing over a shared value slot in language models

    Jul 11, 2026Oliver Steele, Jiangtao Wen, Yuxing HanTheory of MindLLM Interpretability

  10. Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning

    Jul 8, 2026Pranav Sawant, Jakub KrejčíTransformer InterpretabilityMechanistic Interpretability

  11. Distributed Sparse Interventions in Language Models

    Jul 8, 2026Maximilian S. Ernst, Lorenz Linhardt, Aaron Peikert +1Language Model SteeringLLM Interpretability

  12. Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits

    Jul 2, 2026Zhiren Gong, He Lu, Tiantong Wang +6Circuit DiscoveryMechanistic Interpretability

  13. Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?

    Jun 23, 2026Ayan Antik Khan, Harsh Kohli, Yuekun Yao +2LLM Agent EvaluationMechanistic Interpretability

  14. First-Token Broadcasters: Mechanistic Origins of Language Identity and Distributed Robustness in Transformers

    Jun 21, 2026Arjun Pillai, Christian Hoang, Anjelo Jann LarozaMultilingual Language ModelsLLM Interpretability

  15. Scalable Circuit Learning for Interpreting Large Language Models

    Jun 15, 2026Naiyu Yin, Dennis Wei, Tian Gao +3Circuit DiscoveryLLM Interpretability

  16. Demystifying Variance in Circuit Discovery of LLMs

    Jun 15, 2026Frank Zhengqing Wu, Francesco Tonin, Volkan CevherPrompt SensitivityCircuit Discovery

  17. Localizing Anchoring Pathways in Language Models

    Jun 11, 2026Hillary N. Owusu, Sarah Wiegreffe, Naomi H. FeldmanNumerical Reasoning in Language ModelsLLM Interpretability

  18. When Attribution Patching Lies: Diagnosis and a Second-Order Correction

    Jun 5, 2026Luyang Zhang, Jialu WangGradient-Based AttributionLLM Interpretability

  19. Detecting Unfaithful Chain-of-Thought via Circuit-Guided Internal-External Discrepancy

    May 25, 2026Xu Shen, Zhen Tan, Song Wang +4CoT FaithfulnessLLM Auditing

  20. Mechanistic origins of catastrophic forgetting: why RL preserves circuits better than SFT?

    May 21, 2026Jeanmely Rojas Nunez, Viraj Sawant, Nathan Allen +4Supervised Fine-TuningMechanistic Interpretability

  21. Language-Switching Triggers Take a Latent Detour Through Language Models

    May 18, 2026Francis Kulumba, Wissam Antoun, Théo Lasnier +2LLM Backdoor AttacksMechanistic Interpretability

  22. All Circuits Lead to Rome: Rethinking Functional Anisotropy in Circuit and Sheaf Discovery for LLMs

    May 12, 2026Xi Chen, Mingyu Jin, Jingcheng Niu +7Circuit DiscoveryLLM Interpretability

  23. Data-driven Circuit Discovery for Interpretability of Language Models

    May 9, 2026Daking Rai, Mor Geva, Ziyu YaoCircuit DiscoveryLLM Interpretability

  24. How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits

    May 8, 2026Michael Li, Nishant SubramaniCircuit DiscoveryMechanistic Interpretability