Circuit Discovery

Momentum

4 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 29

All topics
CardsList
  1. Circuit-Diff: Factual Edit-based Intervention Method for Localizing Knowledge in Attribution Graphs

    Sep 20, 2026Edward G. Friedman, Xiangchen SongCircuit DiscoveryMechanistic Interpretability

  2. Sparse Weight and Edge Circuit Discovery in Transformer-based Acoustic Models

    Sep 11, 2026Jiankun Wei, Ewan Dunbar, Gerald PennTransformer InterpretabilityCircuit Discovery

  3. Analog-DB: An Agent-First Analog Integrated Circuit Database, From Blocks to Systems

    Sep 1, 2026Danial Noori Zadeh, Mohamed B. ElamienCircuit DiscoveryElectronic Design Automation

  4. Circuit Claims Depend on What Is Extracted and How It Is Compared

    Jul 21, 2026Yang Sheng, Jie FuTransformer InterpretabilityCircuit Discovery

  5. A Shared Subcircuit Lets LLMs Count Down Across Tasks

    Jul 14, 2026Jacob Dunefsky, Wes Gurnee, Emmanuel AmeisenCircuit DiscoveryCircuits in Language Models

  6. Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits

    Jul 2, 2026Zhiren Gong, He Lu, Tiantong Wang +6Circuit DiscoveryMechanistic Interpretability

  7. FactorLibrary: From Polynomials to Circuits via Recursive Subgoals

    Jun 24, 2026Rohan Pandey, Michael Ruofan Zeng, Weikun K. Zhang +5Circuit DiscoveryReinforcement Learning

  8. Scalable Circuit Learning for Interpreting Large Language Models

    Jun 15, 2026Naiyu Yin, Dennis Wei, Tian Gao +3Circuit DiscoveryLLM Interpretability

  9. Demystifying Variance in Circuit Discovery of LLMs

    Jun 15, 2026Frank Zhengqing Wu, Francesco Tonin, Volkan CevherPrompt SensitivityCircuit Discovery

  10. Circuit Tracing in Autoregressive Protein Language Models

    Jun 14, 2026Darin Tsui, William Deinzer, Daniel Saeedi +1Circuit DiscoveryProtein Fitness Prediction

  11. Many Circuits, One Mechanism: Input Variation and Evaluation Granularity in Circuit Discovery

    Jun 4, 2026Alireza Bayat Makou, Jingcheng Niu, Subhabrata Dutta +1Circuit DiscoveryMechanistic Interpretability

  12. MechRL: Reinforcement Learning Agents Perform Circuit Discovery for Mechanistic Interpretability

    May 25, 2026Barsat KhadkaTransformer InterpretabilityCircuit Discovery

  13. From Circuit Evidence to Mechanistic Theory: An Inductive Logic Approach

    May 20, 2026Nura Aljaafari, Danilo S. Carvalho, Andre FreitasCircuit DiscoveryMechanistic Interpretability

  14. Transformers Linearly Represent Highly Structured World Models

    May 13, 2026Roman Kniazev, Nathanaël FijalkowCircuit DiscoveryWorld Models

  15. All Circuits Lead to Rome: Rethinking Functional Anisotropy in Circuit and Sheaf Discovery for LLMs

    May 12, 2026Xi Chen, Mingyu Jin, Jingcheng Niu +7Circuit DiscoveryLLM Interpretability

  16. Data-driven Circuit Discovery for Interpretability of Language Models

    May 9, 2026Daking Rai, Mor Geva, Ziyu YaoCircuit DiscoveryLLM Interpretability

  17. How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits

    May 8, 2026Michael Li, Nishant SubramaniCircuit DiscoveryMechanistic Interpretability

  18. Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft

    Apr 27, 2026Zhou Ziheng, Huacong Tang, Jinyuan Zhang +9AI Agents for Scientific DiscoveryCircuit Discovery

  19. Beyond Transfer Accuracy: Mechanism-Guided Controlled Adaptation for Low-Resource Languages

    Jan 13, 2026Khumaisa Nur'aini, Ayu Purwarianti, Alham Fikri Aji +1Selective Fine-TuningCircuit Discovery