Language Model Steering

Latest papers 171

All topics
CardsList
  1. FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models

    Apr 16, 2026Zixuan Weng, Jinghuai Zhang, Kunlin Cai +3Language Model SteeringLLM Safety

  2. What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal

    Apr 9, 2026Stephen Cheng, Sarah Wiegreffe, Dinesh ManochaLanguage Model SteeringLLM Interpretability

  3. Persona Matters: Effects of Activation Steering on Short Answer Generation and Scoring

    Apr 8, 2026Yongchao Wu, Aron HenrikssonOpen-Ended GenerationLanguage Model Steering

  4. From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions

    Mar 9, 2026Rishab Alagharu, Ishneet Sukhvinder Singh, Shaibi Shamsudeen +2Language Model SteeringLLM Refusal Behavior

  5. Watch the Model Think: On-Policy Extraction of Activation Steering Vectors

    Feb 15, 2026Xuanbo Su, Yingfang Zhang, Hao Luo +3Language Model SteeringRepresentation Steering

  6. Endogenous Resistance to Activation Steering in Language Models

    Feb 6, 2026Alex McKenzie, Keenan Pepper, Stijn Servaes +6Language Model SteeringLanguage Model Robustness

  7. Towards Understanding Steering Strength

    Feb 2, 2026Magamed Taimeskhanov, Samuel Vaiter, Damien GarreauLanguage Model SteeringActivation Steering

  8. From Directions to Regions: Decomposing Activations in Language Models via Local Geometry

    Feb 2, 2026Or Shafran, Shaked Ronen, Omri Fahn +3Language Model SteeringLLM Interpretability

  9. ILRR: Inference-Time Steering Method for Masked Diffusion Language Models

    Jan 29, 2026Eden Avrahami, Eliya NachmaniMasked Diffusion ModelsLanguage Model Steering

  10. Cross-Lingual Activation Steering for Multilingual Language Models

    Jan 23, 2026Rhitabrat Pokharel, Ameeta Agrawal, Tanay NagarMultilingual Language ModelsLanguage Model Steering

  11. Bridging Mechanistic Interpretability and Prompt Engineering with Gradient Ascent for Interpretable Persona Control

    Jan 6, 2026Harshvardhan Saini, Yiming Tang, Dianbo LiuLanguage Model SteeringLLM Interpretability

  12. Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness

    Oct 6, 2025Amin Banayeeanzade, Ala N. Tak, Fatemeh Bahrani +5Language Model SteeringPersonality Modeling in Language Models

  13. Eyes-on-Me: Scalable RAG Poisoning through Transferable Attention-Steering Attractors

    Oct 1, 2025Yen-Shan Chen, Sian-Yao Huang, Cheng-Lin Yang +1Language Model SteeringRAG Poisoning Attacks

  14. VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models

    Sep 29, 2025Ravikumar Balakrishnan, Mansi PhuteLanguage Model SteeringLarge Vision-Language Models

  15. Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators

    Sep 3, 2025Dani Roytburg, Matthew Bozoukov, Matthew Nguyen +3LLM-as-a-JudgeLanguage Model Steering

  16. REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering

    Jun 10, 2025Li-Ming Zhan, Bo Liu, Chengqiang Xie +2Transformer InterpretabilityLanguage Model Steering

  17. LiSeCo: Linear Semantic Control for Language Generation

    May 24, 2024Emily Cheng, Carmen Amo AlonsoLanguage Model SteeringControllable Text Generation

  18. SaFeR-Steer: Evolving Multi-Turn MLLMs via Synthetic Bootstrapping and Feedback Dynamics

    Date pendingHaolong Hu, Hanyu Li, Tiancheng He +6Language Model SteeringMultimodal Large Language Models