Language Model Steering

Latest papers 171

All topics
CardsList
  1. LLMs Silently Correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering

    Jul 7, 2026Huan Wu, Ali Emami, Muhammad Furquan Hassan +5Language Model SteeringSocial Bias in Language Models

  2. Controlling Tool Use with Heading-Specific Activation Steering

    Jul 7, 2026Yuqi Chen, Vincent Siu, Yang Liu +2Language Model SteeringLLM Tool Use

  3. A Coin Flip Per Token: Bernoulli Sparse Steering of Large Language Models

    Jul 6, 2026Nima Eshraghi, Lovedeep Gondara, Yuqing Huang +5Language Model SteeringSparse Autoencoders

  4. On the Limits of Steering Vectors for Preference-Aligned Generation

    Jul 2, 2026Melanie Subbiah, Zara Hall, Kathleen McKeownLLM AlignmentLanguage Model Steering

  5. CreativityNeuro: Steering Language Model Weights to Improve Divergent Thinking and Reduce Mode Collapse

    Jul 1, 2026Samuel Schapiro, Core Francisco Park, Felix Sosa +1Language Model SteeringComputational Creativity

  6. A Geometric Perspective on Composable Emotion Steering in Text-to-Speech Models

    Jul 1, 2026Siyi Wang, James Bailey, Ting DangLanguage Model SteeringConditional Flow Matching

  7. Mechanistic Personality Analysis of LLMs Steering Personality via Latent Feature Interventions

    Jun 27, 2026David Courtis, Ting HuLanguage Model SteeringLLM Interpretability

  8. Search for Truth from Reasoning: A Dynamic Representation Editing Framework for Steering LLM Trajectories

    Jun 26, 2026Tianlong Wang, Yuhang Wang, Weibin Liao +5Language Model SteeringRepresentation Geometry in Language Models

  9. Forecasting With LLMs: Improved Generalization Through Feature Steering

    Jun 25, 2026Humzah Merchant, Bradford LevyLanguage Model SteeringLLM Interpretability

  10. Refusal Lives Downstream of Persona in Chat Models

    Jun 24, 2026Viola Zhong, Qirui LiLanguage Model SteeringLLM Refusal Behavior

  11. Detecting and Controlling Sycophancy with Cascading Linear Features

    Jun 23, 2026Maty Bohacek, Rishub Jain, Nicholas Dufour +3LLM SycophancyLanguage Model Steering

  12. TIPS: Topological Ill-Posedness Probing and Steering in Large Language Models

    Jun 22, 2026Guangyu Jiang, Sizhe Tang, Mahdi Imani +2Language Model SteeringQuestion Answering

  13. The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

    Jun 21, 2026Shivam Ratnakar, Kartikeya VatsLanguage Model SteeringAdversarial Attacks on LLMs

  14. ORBIT: Training-Free Multi-Attribute Behavioral Steering via Orthogonal Subspace Rotation

    Jun 21, 2026Narges Ghasemi, Amir Ziashahabi, Salman Avestimehr +1Language Model SteeringActivation Steering

  15. Answer Engineering: Local Trajectory Editing for Protocol-Constrained Decision Making in Large Language Models

    Jun 19, 2026Victor Lavrenko, Anastasiia MolodnitskaiaLanguage Model SteeringClinical Decision Support

  16. Want Better Synthetic Data? Steer It: Activation Steering for Low-Resource Language Generation

    Jun 16, 2026Jan Cegin, Daniil Gurgurov, Yusser Al Ghussin +1Language Model SteeringSynthetic Data Generation for Language Models

  17. High-Dimensional Random Projection for Activation Steering in Language Models

    Jun 13, 2026Minh-Hieu Pham, Bach Do, Laziz Abdullaev +2Language Model SteeringRepresentation Geometry in Language Models

  18. Order Is Not Control: Driven-Dissipative Response Laws Across Artificial and Biological Systems

    Jun 11, 2026Gareth Seneque, Lap-Hang Ho, Nafise Erfanian Saeedi +2Dynamical SystemsLanguage Model Steering

  19. When is Your LLM Steerable?

    Jun 10, 2026Chenrui Fan, Yize Cheng, Ming Li +2Language Model Steering

  20. Steering Where to Listen: Instruction-Based Activation Steering Redirects Temporal Attention in Large Audio-Language Models

    Jun 9, 2026Tsung-En Lin, Hung-Yi LeeLanguage Model SteeringAudio Understanding

  21. Scenario-based Probing and Steering Cultural Values in Large Language Models--Extended Version

    Jun 9, 2026Trung Duc Anh Dang, Tung Kieu, Sarah MasudLanguage Model SteeringCultural Alignment

  22. Predicting Future Behaviors in Reasoning Models Enables Better Steering

    Jun 9, 2026Evgenii Kortukov, Piotr Komorowski, Florian Klein +5Language Model SteeringRepresentation Steering

  23. Interpreting and Steering a Text-to-Speech Language Model with Sparse Autoencoders

    Jun 8, 2026Nikita Koriagin, Georgii Aparin, Nikita Balagansky +1TTS SynthesisLanguage Model Steering