Circuits in Language Models

Latest papers 69

All topics
CardsList
  1. Navigating by Old Maps: The Pitfalls of Static Mechanistic Localization in LLM Post-Training

    May 7, 2026Hang Chen, Jiaying Zhu, Hongyang Chen +3Supervised Fine-TuningTransformer Interpretability

  2. Differentiable Faithfulness Alignment for Cross-Model Circuit Transfer

    Apr 27, 2026Shun Shao, Binxu Wang, Shay B. Cohen +2LLM InterpretabilityMechanistic Interpretability

  3. What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal

    Apr 9, 2026Stephen Cheng, Sarah Wiegreffe, Dinesh ManochaLanguage Model SteeringLLM Interpretability

  4. Mechanism Shift During Post-training from Autoregressive to Masked Diffusion Language Models

    Jan 21, 2026Injin Kong, Hyoungjoon Lee, Yohan JoMasked Diffusion ModelsAutoregressive Diffusion