Causal Interventions in Language Models

Latest papers 317

All topics
CardsList
  1. When Does the Concept of "Dog" Emerge in an Audio LLM?

    Sep 27, 2026Zhe Wang, Shiqi Liu, Ruiyun Zhong +2Audio UnderstandingAudio-Language Models

  2. Decoupling Token Roles in Autoregressive Pretraining

    Sep 27, 2026Suqin Yuan, Runqi Lin, Kevin Qinghong Lin +4Language Model PretrainingAutoregressive Language Modeling

  3. Direct Hidden-State Alignment: Mapping and Controlling Preference Expression in LLMs

    Sep 27, 2026Fansheng Zhang, Shengran Guo, Zexiao Wang +3LLM AlignmentPreference Alignment

  4. Thinking Leakage: A Causal Audit of NoThink Post-Training in Hybrid Reasoning Models

    Sep 23, 2026Zehao Liu, Vasant G. HonavarLLM Post-TrainingCausal Interventions in Language Models

  5. Scaling Attention Head Analysis via Gradient-Based Attribution in Context-Aware Machine Translation

    Sep 23, 2026Paweł Mąka, Yusuf Can Semerci, Jan Scholtes +1Gradient-Based AttributionAttention Head Analysis

  6. Circuit-Diff: Factual Edit-based Intervention Method for Localizing Knowledge in Attribution Graphs

    Sep 20, 2026Edward G. Friedman, Xiangchen SongCircuit DiscoveryMechanistic Interpretability

  7. From Concept Alignment to Causal Grounding: An Intervention Test of Chain-of-Thought Faithfulness

    Sep 19, 2026Qianli Wang, Yilong Wang, Dennis Wei +5CoT FaithfulnessLLM Interpretability

  8. Deep Noir: Autonomous Steering Discovery via Architectural Chronometry in Transformer Models

    Sep 17, 2026Frank E. Bobe, Gregory D. Vetaw, Darshan W. Bryner +2Transformer InterpretabilityLanguage Model Steering

  9. Decodability is Not Causality: Dissociating Probe Readouts from Behavioral Drivers via SAE Decomposition

    Sep 16, 2026Devesh Tiwari, Camille Davis, Shivank Sinha +3Causal Interventions in Language ModelsHidden-State Probing

  10. TAME: Token Attribution and Masking for Emergent misalignment

    Sep 15, 2026Md Rayhanul Masud, Md Rizwan ParvezLLM InterpretabilityLLM Fine-Tuning

  11. Empathy Is Steerable but Multi-Axial: Mechanism Geometry and Persona Effects in LLMs

    Sep 14, 2026JuHeon Ha, Byounghan Lee, Yunseo Choi +1Language Model SteeringLLM Interpretability

  12. From Parameters to Answers: How LLMs Retrieve and Use Their Internal Knowledge

    Sep 12, 2026Wenkang Wei, Yuan Fang, Renhe Jiang +2LLM InterpretabilityFactual Knowledge in Language Models

  13. Causal Analysis and Mitigation of Spurious Onsets in Full-Duplex Speech LLMs

    Sep 11, 2026Kento NishiSpeech Language ModelsCausal Interventions in Language Models

  14. The information geometry of large language models is shared, learned, and controllable

    Sep 11, 2026Dario PicozziInformation GeometryLanguage Model Steering

  15. Through the Looking Glass: Directly Reading and Writing Transformers

    Sep 9, 2026Mark OskinKnowledge EditingTransformer Interpretability

  16. Record Grouping Controls Evidence Weight in Language Models

    Sep 8, 2026Zhongxuan Liu, Sicheng Zhou, Hongzhi WangCausal Interventions in Language Models

  17. Target-Independent Micro-Interventions for Predicting Training Response Across Language-Model Families

    Sep 8, 2026Zhongxuan Liu, Sicheng Zhou, Hongzhi WangCausal Interventions in Language Models

  18. Key Path Identification for Resolving Knowledge Conflicts via SAE-based Steering

    Sep 8, 2026Wenbo Zhang, Zhongxiang Sun, Zhiguang Han +1Language Model SteeringKnowledge Conflicts in Language Models

  19. InfluenceField: A Differentiable Field with Interventionally Identifiable Causal Structure for Multimodal World Modeling

    Sep 7, 2026Zihao Yang, Zijia Wang, Zhiqiu HuangCausal Representation LearningCausal World Models