Language Model Steering

Latest papers 171

All topics
CardsList
  1. The Governance of Human-LLM Interaction: Safety Gating, Civility Steering, and Affective Default Lock-In

    Jun 6, 2026Manuele Reani, Hongjian Zhang, Hongyu TianLanguage Model SteeringLLM Safety Evaluation

  2. Adversarial Robustness of Activation Steering in Large Language Models

    Jun 5, 2026Kien Le, Thai LeLLM EvaluationLanguage Model Steering

  3. A Geometric Account of Activation Steering through Angle-Norm Decomposition

    Jun 4, 2026Georgii Aparin, Tatiana GaintsevaLanguage Model SteeringLanguage Modeling

  4. Towards the Readability of LLM-Generated Codes through Multitask Representation Engineering

    Jun 4, 2026Huifan Gao, Liuhua He, Yinghui Pan +4Language Model SteeringRepresentation Engineering

  5. Steering Vectors are an Adversarial Attack Surface

    Jun 4, 2026Abzal Aidakhmetov, Donato Crisostomi, Tommaso Mencattini +3Language Model SteeringAdversarial Attacks on LLMs

  6. Expert-Aware Refusal Steering

    Jun 2, 2026Anna C. Marbut, Daniel R. Olson, Travis J. WheelerMixture-of-Experts Language ModelsLanguage Model Steering

  7. Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning

    Jun 2, 2026Yu Xia, Zhouhang Xie, Xin Xu +4Language Model SteeringCoT Reasoning

  8. Subliminal Learning Is Steering Vector Distillation

    May 31, 2026Camila Blank, Agam Bhatia, Senthooran Rajamanoharan +2Language Model SteeringSubliminal Learning

  9. Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs

    May 30, 2026Jiakang Li, Guanyu Zhu, Can Jin +8Reward ModelingLanguage Model Steering

  10. SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors

    May 30, 2026Yekaterina Yegorova, Argyrios Gerogiannis, Haolong Zheng +3Language Model SteeringAutomatic Speech Recognition

  11. Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines

    May 29, 2026Mikkel Godsk Jørgensen, Lars Kai HansenLanguage Model SteeringLLM Interpretability

  12. Cross-Lingual Steering for Figurative Language Generation

    May 28, 2026Linfeng Liu, Tiffany Zhan, Louie Hong Yao +2Multilingual Language ModelsLanguage Model Steering

  13. UniSteer: Text-Guided Flow Matching in Activation Space for Versatile LLM Steering

    May 28, 2026Yingdong Shi, Ruiming Zhang, Changming Li +4Flow MatchingLanguage Model Steering

  14. Causal Interventions on Continuous Variables: A Case Study on Verb Bias in Steering Vectors for In-Context Learning

    May 28, 2026Zhenghao Herbert Zhou, R. Thomas McCoy, Robert FrankLanguage Model SteeringCausal Reasoning in Language Models

  15. Sense Representations Are Inducible Interfaces

    May 27, 2026Jan Christian Blaise Cruz, Alham Fikri AjiLanguage Model SteeringLanguage Modeling

  16. Riemannian-Manifold Steering: Geometry-Aware Generative Autoencoders for Label-Free Steering

    May 24, 2026Narmeen Oozeer, Shivam Raval, Philip Quirke +4Language Model SteeringRepresentation Steering

  17. DFKI-MLT at SemEval-2026 TASK 7: Steering Multilingual Models Towards Cultural Knowledge

    May 21, 2026Yusser Al Ghussin, Daniil Gurgurov, Yasser Hamidullah +3Multilingual Language ModelsMultilingual Language Model Evaluation

  18. Steered Generation via Gradient-Based Optimization on Sparse Query Features

    May 21, 2026Sumanta Bhattacharyya, Pedram RooshenasConstrained Motion PlanningLanguage Model Steering

  19. Multilingual Steering by Design: Multilingual Sparse Autoencoders and Principled Layer Selection

    May 21, 2026Yusser Al Ghussin, Daniil Gurgurov, Tanja Baeumel +3Multilingual Language ModelsLanguage Model Steering

  20. Manifold-Guided Attention Steering

    May 20, 2026Ian Li, Kapilesh Guruprasad, Raunak Sengupta +3Language Model SteeringSelf-Attention

  21. How Far Will They Go? Red-Teaming Online Influence with Large Language Models

    May 20, 2026Daniel C. Ruiz, Anna Serbina, Ashwin Rao +2Language Model SteeringLLM Auditing

  22. Playing Devil's Advocate: Off-the-Shelf Persona Vectors Rival Targeted Steering for Sycophancy

    May 20, 2026Ishaan Kelkar, Vikram Kakaria, Nebras Alam +3LLM SycophancyLanguage Model Steering

  23. The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering

    May 20, 2026Yefan Zhou, Yilun Zhou, Austin Xu +3Language Model SteeringActivation Steering

  24. Adaptive Probe-based Steering for Robust LLM Jailbreaking

    May 19, 2026Junxi Chen, Junhao Dong, Xiaohua XieLanguage Model SteeringAdversarial Attacks on LLMs

  25. Selective Safety Steering via Value-Filtered Decoding

    May 14, 2026Bat-Sheva Einbinder, Hen Davidov, Yee Whye Teh +2Language Model DecodingLanguage Model Steering