Language Model Steering

Latest papers 171

All topics
CardsList
  1. From Uncertainty to Action: Learning to Steer LLM Agents

    Oct 6, 2026Hanwen Li, Jinhao Duan, Guanhua Zhu +4Language Model SteeringLLM Agents

  2. Latent space bias directions in LLMs capture confidence, not fairness

    Oct 6, 2026Stephanie Buttigieg, Maeve Madigan, Parameswaran Kamalaruban +1Debiased MLLanguage Model Steering

  3. Does Steering Break Your Model? A Multi-Dimensional Evaluation Suite for LLM Steering Methods

    Oct 6, 2026Haotian Yang, Huikang Jiang, Yucheng Wu +4LLM EvaluationLanguage Model Steering

  4. Steering by Influence: Curvature Aware Data Weighting for Activation Steering

    Oct 5, 2026James A. E. Dixon, Stephen J. Roberts, Francesco QuinzanLanguage Model SteeringInfluence Functions

  5. HeadEdit: Calibrating Language Model Behavior Through the Frozen Unembedding Matrix

    Oct 1, 2026Zirui He, Haiyan Zhao, Jingyu Hu +5Language Model SteeringLanguage Model Calibration

  6. Kernelized Activation Steering

    Oct 1, 2026Laziz U. Abdullaev, Minh-Hieu Pham, Bach Do +2Language Model SteeringActivation Steering

  7. Reason in Style: Discovering and Controlling Style in Language Models

    Sep 30, 2026Ioana Marinescu, Eric Karl Oermann, Kyunghyun ChoUnsupervised LearningLanguage Model Steering

  8. Values as Style: Disentangling Values from Semantics with One-Way Mixing for Low-Damage LLM Steering

    Sep 30, 2026Jiale Dai, Hongcan Deng, Liuxian Ma +2Disentangled Representation LearningLLM Alignment

  9. When Reasoning Goes Astray: Attention Dynamics of Uncontrolled Reasoning

    Sep 30, 2026Yuanhe Zhang, Ziwei Wang, Jie Ren +6Language Model SteeringOverthinking in Language Models

  10. AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation

    Sep 29, 2026Rishabh Agrawal, Hejie Cui, Shasha Li +2Language Model SteeringLLM Agent Self-Improvement

  11. Persona Dosing: Calibrated Activation Steering for Graded Trait Control

    Sep 28, 2026Zehao Jin, Junran Wang, Ruixuan Deng +4Language Model SteeringPersonality Modeling in Language Models

  12. How to Tame a Multi-Headed Hydra? Adaptive Multi-Category Safety Steering for Large Language Models

    Sep 28, 2026Chenxi Wang, Ruiyang Huang, Li Huang +1Language Model SteeringLLM Safety

  13. Steering Language Model Goals with Value Transplant

    Sep 28, 2026Pengcheng Jiang, Fabien RogerLanguage Model SteeringLanguage Model-Based Control

  14. Minimally Invasive Steering of Language Models

    Sep 24, 2026Taha Entesari, Jingyu Zhang, Daniel Khashabi +1Language Model SteeringInference-Time Language Model Alignment

  15. Same Outcome, Different Readout: What Does a Steerable Valence Direction in LLMs Represent?

    Sep 19, 2026Weihan Li, Xinlei Chen, Yuhan Song +2Language Model SteeringLLM Interpretability

  16. Deep Noir: Autonomous Steering Discovery via Architectural Chronometry in Transformer Models

    Sep 17, 2026Frank E. Bobe, Gregory D. Vetaw, Darshan W. Bryner +2Transformer InterpretabilityLanguage Model Steering

  17. Target-Language Generation in Multilingual Models: Activation Steering and Optimal Control

    Sep 15, 2026James A. Michaelov, Carmen Amo Alonso, Tyler A. Chang +1Multilingual Language ModelsMultilingual Language Model Evaluation

  18. Empathy Is Steerable but Multi-Axial: Mechanism Geometry and Persona Effects in LLMs

    Sep 14, 2026JuHeon Ha, Byounghan Lee, Yunseo Choi +1Language Model SteeringLLM Interpretability

  19. SteerDuplex: Steerable Duplex Speech Dialogue Models

    Sep 14, 2026Utkarsh Tyagi, Ramaneswaran Selvakumar, Advait Gosai +13Language Model SteeringSpoken Dialogue Systems

  20. The information geometry of large language models is shared, learned, and controllable

    Sep 11, 2026Dario PicozziInformation GeometryLanguage Model Steering

  21. Compositional Multilingual and Behavioral Attribute Steering

    Sep 8, 2026Hyun Gu Kang, Daniil Gurgurov, Tanja Baeumel +2Language Model Steering

  22. Key Path Identification for Resolving Knowledge Conflicts via SAE-based Steering

    Sep 8, 2026Wenbo Zhang, Zhongxiang Sun, Zhiguang Han +1Language Model SteeringKnowledge Conflicts in Language Models

  23. GAPS: Dimension-Level Gates for Conditional Activation Steering

    Sep 1, 2026Moghis Fereidouni, Muhammad Umair Haider, Hassan Sajjad +1Language Model SteeringLLM Safety

  24. Topological Steering

    Sep 1, 2026Benoît Guérand, Tan Minh NguyenLanguage Model SteeringLanguage Model Robustness

  25. Controlling Refusal Behavior of LLMs via Stiefel-Constrained Rotation Steering

    Aug 31, 2026Kirill Bunin, Dmitry Bylinkin, Vladimir Aletov +3Language Model SteeringRefusal Behavior in Language Models

  26. ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives

    Aug 31, 2026Hoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim +1Language Model SteeringLLM Safety Alignment

  27. Attribute-Based Activation Steering of LLMs for Group-Specific Explanation Generation

    Aug 29, 2026Leandra Fichtel, Janek Prange, Henning WachsmuthLanguage Model SteeringActivation Steering

  28. LITERARYBIGFIVE: Author-Personalized Text Generation in a Unified Interpretable Space

    Aug 24, 2026Jinghui Zhang, Lang Gao, Ao Li +5Language Model SteeringLLM Interpretability

  29. Dear Algo: A Precision-First Agentic Intent Layer for Unified Search and Recommendation

    Aug 16, 2026Rui Wang, Jiazhou Wang, Zheng Wei +16Language Model SteeringRecommender Systems

  30. Deployable Per-Instance Multi-Layer Activation Steering for Large Language Models

    Aug 9, 2026Muhammad Faishal Adly Nelwan, Alfan Farizki WicaksonoLanguage Model SteeringControllable Text Generation

  31. Safety Cost of Steering Vectors Is Separable and Reducible

    Aug 9, 2026Yuxiao Li, Gjergji KasneciLanguage Model SteeringLLM Safety Alignment

  32. Training-Free Token-Level Steering for LLM Personalized Co-Writing

    Aug 6, 2026Wenhao Mao, Chengbin Hou, Weixiao Wang +4Language Model SteeringPersonalized Text Generation

  33. Cautious Context Steering for Language Model Personalization

    Aug 6, 2026Gihoon Kim, Jeyoung Lee, Suhan Woo +4Language Model SteeringLLM Personalization

  34. CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits

    Aug 6, 2026Mehrshad Saadatinia, Parsa Razmara, Ardalan Aryashad +2LLM AlignmentLanguage Model Steering

  35. FOCUS: Decoupling Expert Personas in LLMs to Enhance Domain Expert Capabilities

    Aug 6, 2026Guanyu Wang, Zidi Zhang, Xu ChuLanguage Model SteeringPersonality Modeling in Language Models

  36. Scaling Inherently Interpretable Language Models

    Aug 6, 2026Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail +7Language Model SteeringLLM Interpretability

  37. On the Generalization of Steering Vectors for Chain-of-Thought Faithfulness

    Jul 31, 2026Matthew Nguyen, Kyle Cox, Austin Meek +1CoT FaithfulnessLanguage Model Steering

  38. Metaphor-Induced Algorithmic Steering: Cross-Domain Procedural Transfer in LLM Code Generation

    Jul 30, 2026Zhibo Hu, Chen Wang, Yanfeng Shu +3Language Model SteeringCode Generation

  39. Latent-IM: Latent Interaction Management for Speech LLMs

    Jul 29, 2026Adar Avsian, Atahan Dokme, Tony Woo +1Language Model SteeringSpeech Language Models

  40. Steering Instruction Hierarchies at Inference Time

    Jul 28, 2026Siqi Zeng, Sewoong Lee, Han Zhao +1Language Model SteeringLLM Safety Alignment

  41. Forecasting Side Effects of Activation Steering

    Jul 28, 2026Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang +1Language Model SteeringLLM Auditing

  42. Where Steering Signals Come From: Activation Source Selection in Activation Steering

    Jul 28, 2026Jiaran Ye, Lingxu Ran, Zijun Yao +5Language Model SteeringActivation Steering

  43. Auditing Alignment Controllability in LLMs via Political Axes

    Jul 26, 2026Bartol Bućan, Nikola Sočec, Sarah Isufi +5LLM AlignmentLanguage Model Steering

  44. LoRA for Gender-Inclusive Rewriting and Activation Steering for Counter-Narrative Generation

    Jul 25, 2026Akhil Rajeev P, Manoj Balaji JGender Bias in Language ModelsLanguage Model Steering

  45. Semantic Drift and the Stability of Operator Control in Reasoning-Class Decision Support Systems

    Jul 8, 2026M. L. Kaluzhsky, V. A. EfirovLanguage Model SteeringHuman-AI Interaction

  46. Distributed Sparse Interventions in Language Models

    Jul 8, 2026Maximilian S. Ernst, Lorenz Linhardt, Aaron Peikert +1Language Model SteeringLLM Interpretability