Circuits in Language Models

Latest papers 69

All topics
CardsList
  1. SafeEvo: Deciphering the Safety Alignment Mechanism and Evolution in Language Models

    Oct 7, 2026Miao Yu, Hao Huang, Lu Yuan +3LLM Safety AlignmentLLM Alignment

  2. Finding the Heads and the Neurons Responsible for Network Information Retrieval in Language Models

    Oct 6, 2026Md Abdul Kadir, Md Mohasin Hossain, Daniel SonntagAttention Head AnalysisLLM Interpretability

  3. Rethinking Circuit Evaluation: Do Circuits Explain Model Errors?

    Sep 28, 2026Li Zhang, Chuqin Geng, Mark Zhang +4Faithfulness of Language Model ExplanationsMechanistic Interpretability

  4. Social Circuits behind Multi-agent Echo Chambers

    Sep 28, 2026Chuiyang Meng, Wenlu Yu, Ming Tang +1Multi-Agent LLM SystemsMulti-Agent Systems

  5. The Commit-Abstain Circuit: Why Language Models Hallucinate Instead of Abstaining

    Sep 26, 2026Vy Nguyen, Ziqi Xu, Jeffrey Chan +5Hallucination in Language ModelsCircuits in Language Models

  6. Circuit Hypernetworks for Quantum-Augmented Diffusion Language Models

    Sep 21, 2026Xiaoqiang Wang, Mengyang Xiong, Jun Dai +1LLM Fine-TuningQuantum Machine Learning

  7. The Token Before the Value Is the Key: How Hybrid Architectures Organize Induction Circuits

    Sep 14, 2026Ke Cheng, Xin Xu, Yixiao Chen +6Language ModelingCircuits in Language Models

  8. Where Decoder Cosine Similarity Fails for SAE Feature Flow Discovery

    Sep 14, 2026Hendrik Droste, Christian Medeiros Adriano, Kathrin Korte +1Transformer InterpretabilitySparse Autoencoders

  9. Through the Looking Glass: Directly Reading and Writing Transformers

    Sep 9, 2026Mark OskinKnowledge EditingTransformer Interpretability

  10. S^3martCirc: Self-supervised Smart Circuit Discovery

    Sep 1, 2026Wendy Zheng, Yinhan He, Liang Wu +1LLM InterpretabilityMechanistic Interpretability

  11. Decodable But Not Detachable: Training Data Granularity Determines Parametric Modularity in Large Language Models

    Aug 10, 2026Marcus Armstrong, Navid Ayoobi, Arjun MukherjeeLLM InterpretabilityCircuits in Language Models

  12. Who Bridges Safety? Identifying and Targeting Cross-Lingual Shared Safety Pathways

    Aug 10, 2026Shuyi Miao, Wangjie Qiu, Pengyang Shao +4LLM Safety AlignmentLLM Safety

  13. Can Graph Learning Learn Circuits?

    Aug 9, 2026Chester Tan, Moritz Lampert, Courtney Maynard +3Graph Neural NetworksMechanistic Interpretability

  14. CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits

    Aug 6, 2026Mehrshad Saadatinia, Parsa Razmara, Ardalan Aryashad +2LLM AlignmentLanguage Model Steering

  15. Test, then Route: How Language Models Execute In-Context Conditional Rules Across Models and Languages

    Aug 4, 2026Luxshan Thavarasa, Sivasuthan SukumarIn-Context LearningCircuits in Language Models

  16. Sparse Weight Decomposition for Efficient Circuit Extraction

    Aug 4, 2026Chuanhao Yan, Xuhan Huang, Yawen Duan +4Transformer InterpretabilityMechanistic Interpretability

  17. Hidden APIs in Language Models: Discovering Reusable Causal Interfaces from Forked Futures

    Jul 30, 2026SiYuan Ma, Yiqin Luo, Zhangji +8LLM InterpretabilityCausal Abstraction