Representation Steering

Momentum

3 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 22

All topics
CardsList
  1. Training-Free Instruction TTS Gender Bias Calibration Using Model-Adaptive Steering

    Oct 7, 2026Kuan-Yu Chen, Yi-Cheng Lin, Jeng-Lin Li +1Text-to-SpeechTTS Synthesis

  2. Who Is Left of Whom? Tracing Spatial Evidence and Role Binding in Relative-Position Reasoning

    Sep 28, 2026Yingjin Song, Denis Paperno, Albert GattVisual Spatial ReasoningRelational Reasoning

  3. A Probe Shift Is Not a Fairness Fix: The Limits of Representation Steering in Speech Models

    Sep 16, 2026Nicolas Bourrel, Abderrahmane Issam, Gerasimos SpanakisASR EvaluationDemographic Bias in ASR

  4. NullEdit: Stealthy Image Protection via VLM Condition Redirection

    Aug 11, 2026Weiyao Huang, Liqin Wang, Ziqi Sheng +1VLM RobustnessRepresentation Steering

  5. Risky Business: Measuring The Faithfulness-Safety Tension

    Aug 4, 2026Dominik Meier, Luca Joshua Francis, Marco Bernhard Kaiser +3CoT FaithfulnessLanguage Model Safety Evaluation

  6. Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering

    Jul 28, 2026Maria Rosaria Briglia, Igor Maljkovic, Antonio Emanuele Cinà +3Adversarial Attacks on VLMsRepresentation Engineering

  7. Controlling Tool Use with Heading-Specific Activation Steering

    Jul 7, 2026Yuqi Chen, Vincent Siu, Yang Liu +2Language Model SteeringLLM Tool Use

  8. Pulling The REINS: Training-Free Safety Alignment of Video Diffusion Models via Representation Steering

    Jun 15, 2026Rohit Kundu, Arindam Dutta, Sarosij Bose +2Diffusion Model AlignmentVideo Diffusion Models

  9. Predicting Future Behaviors in Reasoning Models Enables Better Steering

    Jun 9, 2026Evgenii Kortukov, Piotr Komorowski, Florian Klein +5Language Model SteeringRepresentation Steering

  10. Whisper Hallucination Detection and Mitigation via Hidden Representation Steering and Sparse AutoEncoders

    Jun 5, 2026Georgii Aparin, Vadim Popov, Tasnima Sadekova +1Audio-Language Model Hallucination DetectionSparse Autoencoders

  11. Riemannian-Manifold Steering: Geometry-Aware Generative Autoencoders for Label-Free Steering

    May 24, 2026Narmeen Oozeer, Shivam Raval, Philip Quirke +4Language Model SteeringRepresentation Steering

  12. SwordBench: Evaluating Orthogonality of Steering Image Representations

    May 10, 2026Vladimir Zaigrajew, Dawid Pludowski, Hubert Baniecki +1Vision Foundation ModelsRepresentation Engineering

  13. Don't Lose Focus: Activation Steering via Key-Orthogonal Projections

    May 7, 2026Haoyan Luo, Mateo Espinosa Zarlenga, Mateja JamnikLanguage Model SteeringSelf-Attention

  14. Conceptors for Semantic Steering

    May 6, 2026Ilias Triantafyllopoulos, Young-Min Cho, Ren Tao +6Language Model SteeringRepresentation Steering

  15. The Cylindrical Representation Hypothesis for Language Model Steering

    May 3, 2026Lang Gao, Jinghui Zhang, Wei Liu +7Language Model SteeringLLM Interpretability

  16. Knowledge Vector of Logical Reasoning in Large Language Models

    Apr 26, 2026Zixuan Wang, Yuanyuan LeiLLM InterpretabilityRepresentation Engineering

  17. What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal

    Apr 9, 2026Stephen Cheng, Sarah Wiegreffe, Dinesh ManochaLanguage Model SteeringLLM Interpretability

  18. Watch the Model Think: On-Policy Extraction of Activation Steering Vectors

    Feb 15, 2026Xuanbo Su, Yingfang Zhang, Hao Luo +3Language Model SteeringRepresentation Steering

  19. Beyond Forgetting: Representation Misdirection Elicits Controllable Side Behaviors and Capabilities

    Jan 29, 2026Tien Dang, The-Hai Nguyen, Dinh Mai Phuong +5Linear Representation HypothesisControllable Text Generation