Language Model Steering

Latest papers 171

All topics
CardsList
  1. LITERARYBIGFIVE: Author-Personalized Text Generation in a Unified Interpretable Space

    Aug 24, 2026Jinghui Zhang, Lang Gao, Ao Li +5Language Model SteeringLLM Interpretability

  2. Dear Algo: A Precision-First Agentic Intent Layer for Unified Search and Recommendation

    Aug 16, 2026Rui Wang, Jiazhou Wang, Zheng Wei +16Language Model SteeringRecommender Systems

  3. Deployable Per-Instance Multi-Layer Activation Steering for Large Language Models

    Aug 9, 2026Muhammad Faishal Adly Nelwan, Alfan Farizki WicaksonoLanguage Model SteeringControllable Text Generation

  4. Safety Cost of Steering Vectors Is Separable and Reducible

    Aug 9, 2026Yuxiao Li, Gjergji KasneciLanguage Model SteeringLLM Safety Alignment

  5. Training-Free Token-Level Steering for LLM Personalized Co-Writing

    Aug 6, 2026Wenhao Mao, Chengbin Hou, Weixiao Wang +4Language Model SteeringPersonalized Text Generation

  6. Cautious Context Steering for Language Model Personalization

    Aug 6, 2026Gihoon Kim, Jeyoung Lee, Suhan Woo +4Language Model SteeringLLM Personalization

  7. CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits

    Aug 6, 2026Mehrshad Saadatinia, Parsa Razmara, Ardalan Aryashad +2LLM AlignmentLanguage Model Steering

  8. FOCUS: Decoupling Expert Personas in LLMs to Enhance Domain Expert Capabilities

    Aug 6, 2026Guanyu Wang, Zidi Zhang, Xu ChuLanguage Model SteeringPersonality Modeling in Language Models

  9. Scaling Inherently Interpretable Language Models

    Aug 6, 2026Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail +7Language Model SteeringLLM Interpretability

  10. On the Generalization of Steering Vectors for Chain-of-Thought Faithfulness

    Jul 31, 2026Matthew Nguyen, Kyle Cox, Austin Meek +1CoT FaithfulnessLanguage Model Steering

  11. Metaphor-Induced Algorithmic Steering: Cross-Domain Procedural Transfer in LLM Code Generation

    Jul 30, 2026Zhibo Hu, Chen Wang, Yanfeng Shu +3Language Model SteeringCode Generation

  12. Latent-IM: Latent Interaction Management for Speech LLMs

    Jul 29, 2026Adar Avsian, Atahan Dokme, Tony Woo +1Language Model SteeringSpeech Language Models

  13. Steering Instruction Hierarchies at Inference Time

    Jul 28, 2026Siqi Zeng, Sewoong Lee, Han Zhao +1Language Model SteeringLLM Safety Alignment

  14. Forecasting Side Effects of Activation Steering

    Jul 28, 2026Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang +1Language Model SteeringLLM Auditing

  15. Where Steering Signals Come From: Activation Source Selection in Activation Steering

    Jul 28, 2026Jiaran Ye, Lingxu Ran, Zijun Yao +5Language Model SteeringActivation Steering

  16. Auditing Alignment Controllability in LLMs via Political Axes

    Jul 26, 2026Bartol Bućan, Nikola Sočec, Sarah Isufi +5LLM AlignmentLanguage Model Steering

  17. LoRA for Gender-Inclusive Rewriting and Activation Steering for Counter-Narrative Generation

    Jul 25, 2026Akhil Rajeev P, Manoj Balaji JGender Bias in Language ModelsLanguage Model Steering

  18. Semantic Drift and the Stability of Operator Control in Reasoning-Class Decision Support Systems

    Jul 8, 2026M. L. Kaluzhsky, V. A. EfirovLanguage Model SteeringHuman-AI Interaction

  19. Distributed Sparse Interventions in Language Models

    Jul 8, 2026Maximilian S. Ernst, Lorenz Linhardt, Aaron Peikert +1Language Model SteeringLLM Interpretability