Steering

Momentum

41 papers in the last four weeks, up 242% on the four weeks before. 0.4% of all new papers.

Jul 13Week of Sep 28

Latest papers 236

All topics
CardsList
  1. Steerable Neural ODEs on Homogeneous Spaces

    May 11, 2026Emma Andersdotter, Daniel Persson, Fredrik OhlssonNeural Ordinary Differential EquationsOrdinary Differential Equations

  2. Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values

    May 11, 2026Haonan Dong, Qiguan Feng, Kehan Jiang +3Human ValuesValue

  3. Exploitation Without Deception: Dark Triad Feature Steering Reveals Separable Antisocial Circuits in Language Models

    May 10, 2026Cameron Berg, Roshni LullaDeceptionLarge Language Model Bias

  4. SwordBench: Evaluating Orthogonality of Steering Image Representations

    May 10, 2026Vladimir Zaigrajew, Dawid Pludowski, Hubert Baniecki +1SteeringEvaluation Benchmarks

  5. Do LLMs Experience an Internal Polylogue? Investigating Reasoning through the Lens of Personas

    May 9, 2026Nils A. Herrmann, Leander Girrbach, Kirill Bykov +1LLM Reasoning StrategiesArtificial Intelligence Personas

  6. When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search

    May 9, 2026John T. Robertson, Jianing Zhu, Haris Vikalo +1Linear Activation SteeringSteering

  7. Can Revealed Preferences Clarify LLM Alignment and Steering?

    May 8, 2026Khurram Yamin, Jingjing Tang, Eric Horvitz +1Large Language Model AlignmentLarge Language Model Decisions

  8. WebTrap: Stealthy Mid-Task Hijacking of Browser Agents During Navigation

    May 8, 2026Zhichao Liu, Wenbo Pan, Haining Yu +3HijackingBrowser Agent

  9. Don't Lose Focus: Activation Steering via Key-Orthogonal Projections

    May 7, 2026Haoyan Luo, Mateo Espinosa Zarlenga, Mateja JamnikLinear Activation SteeringSteering

  10. Molecules Meet Language: Confound-Aware Representation Learning and Chemical Property Steering in Transformer-VAE Latent Spaces

    May 7, 2026Zakaria Elabid, Jan Andrzejewski, Bartosz Brzoza +1Molecular Representation LearningMolecular Generation

  11. P-Guide: Parameter-Efficient Prior Steering for Single-Pass CFG Inference

    May 7, 2026Xin Peng, Ang GaoClassifier-Free GuidanceGenerative Flow Networks

  12. Towards Steering without Sacrifice: Principled Training of Steering Vectors for Prompt-only Interventions

    May 7, 2026Yuntai Bao, Qinfeng Li, Xinyan Yu +6SteeringSupervised Finetuning

  13. Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention

    May 7, 2026Zehao Jin, Ruixuan Deng, Junran Wang +2Linear Activation SteeringSteering

  14. Steering Visual Generation in Unified Multimodal Models with Understanding Supervision

    May 7, 2026Zeyu Liu, Zanlin Ni, Yang Yue +5Multimodal GenerationMultimodal Model

  15. Manifold Steering Reveals the Shared Geometry of Neural Network Representation and Behavior

    May 6, 2026Daniel Wurgaft, Can Rager, Matthew Kowal +13Neural Network RepresentationsLinear Activation Steering

  16. Conceptors for Semantic Steering

    May 6, 2026Ilias Triantafyllopoulos, Young-Min Cho, Ren Tao +6Linear Activation SteeringSteering

  17. Pairwise matrices for sparse autoencoders: single-feature inspection mislabels causal axes

    May 4, 2026Michael A. Riegler, Birk Sebastian Frostelid Torpmann-HagenImproving Sparse AutoencodersModel Activations

  18. The Cylindrical Representation Hypothesis for Language Model Steering

    May 3, 2026Lang Gao, Jinghui Zhang, Wei Liu +7Linear Activation SteeringSteering

  19. Referring Multiple Regions with Large Multimodal Models via Contextual Latent Steering

    May 3, 2026Yun Xing, Hanyuan Liu, Jiahao Nie +1Large Multimodal ModelsRegion

  20. Controlled Steering-Based State Preparation for Adversarial-Robust Quantum Machine Learning

    Apr 30, 2026Sahan Sanjaya, Hari Krishna Parvatham, Emma Andrews +1Quantum Machine LearningQuantum Error Correction

  21. ASAP: An Azimuth-Priority Strip-Based Search Approach to Planar Microphone Array DOA Estimation in 3D

    Apr 28, 2026Ming Huang, Shuting Xu, Leying Yang +6Microphone ArraySteering

  22. UniAda: Universal Adaptive Multi-objective Adversarial Attack for End-to-End Autonomous Driving Systems

    Apr 25, 2026Jingyu Zhang, Jacky Wai Keung, Yan Xiao +3Black-Box Adversarial AttacksSteering

  23. From Concept-Aligned Tokens to Vulnerable Features: Mechanistic Localization of Jailbreaks

    Apr 25, 2026Nilanjana Das, Mathew Dawit, Aman Chadha +1Jailbreak Success RatesUnsafe

  24. Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization

    Apr 24, 2026Weixu Zhang, Ye Yuan, Changjiang Han +7Large Language Model PersonalizationPersonalization

  25. From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models

    Apr 20, 2026Qidong Wang, Junjie Hu, Ming JiangRecent Vision-Language ModelsNeurons

  26. SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models

    Apr 18, 2026Yifu Huo, Chenglong Wang, Ziming Zhu +9LLM Reasoning StrategiesLarge Language Model Reinforcement Learning

  27. Structural Instability of Feature Composition

    Apr 18, 2026Yunpeng ZhouFeature LearningSteering

  28. RankGuide: Tensor-Rank-Guided Routing and Steering for Efficient Reasoning

    Apr 17, 2026Jiayi Tian, Yupeng Su, Ryan Solgi +2Reasoning BenchmarkInference Latency

  29. MidSteer: Optimal Affine Framework for Steering Generative Models

    Apr 17, 2026Tatiana Gaintseva, Andrew Stepanov, Ziquan Liu +4SteeringGenerative Models

  30. FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models

    Apr 16, 2026Zixuan Weng, Jinghuai Zhang, Kunlin Cai +3Inference-Time SteeringSteering

  31. What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal

    Apr 9, 2026Stephen Cheng, Sarah Wiegreffe, Dinesh ManochaLinear Activation SteeringSteering

  32. Persona Matters: Effects of Activation Steering on Short Answer Generation and Scoring

    Apr 8, 2026Yongchao Wu, Aron HenrikssonArtificial Intelligence PersonasPersona Consistency

  33. AViS-Mamba: Adaptive Visual Steering of Audio State-Space Dynamics for Violence Detection

    Apr 2, 2026Damith Chamalke Senadeera, Dimitrios Kollias, Gregory SlabaughAudio-Visual ReasoningFine-Grained Video Understanding

  34. NOUS: Video-Driven 3D Human Reaction Generation via Observation-Reaction Mutual Steering

    Mar 20, 2026Yuan Zhou, Luanyuan Dai, Yongzhi Li +7SteeringComplementary Modalities

  35. From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions

    Mar 9, 2026Rishab Alagharu, Ishneet Sukhvinder Singh, Shaibi Shamsudeen +2RefusalsLarge Language Model Safety

  36. Observing and Controlling Features in Vision-Language-Action Models

    Mar 5, 2026Hugo Buurmeijer, Carmen Amo Alonso, Aiden Swann +1Vision-Language-Action FrameworkEmbodied Artificial Intelligence

  37. Watch the Model Think: On-Policy Extraction of Activation Steering Vectors

    Feb 15, 2026Xuanbo Su, Yingfang Zhang, Hao Luo +3Linear Activation SteeringReasoning Trajectory

  38. Towards Understanding Steering Strength

    Feb 2, 2026Magamed Taimeskhanov, Samuel Vaiter, Damien GarreauSteeringFuture Latent Representations

  39. White-Box Sensitivity Auditing with Steering Vectors

    Jan 23, 2026Hannah Cyberey, Yangfeng Ji, David EvansModel AuditingLarge Language Model Evaluation

  40. Silence is Golden: Mitigating Hallucinations in Large Audio-Language Models via Layer-Weighted Vector Steering

    Oct 14, 2025Tsung-En Lin, Kuan-Yi Lee, Hung-Yi LeeLarge Audio Language ModelsSteering

  41. VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models

    Sep 29, 2025Ravikumar Balakrishnan, Mansi PhuteRecent Vision-Language ModelsSteering

  42. Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators

    Sep 3, 2025Dani Roytburg, Matthew Bozoukov, Matthew Nguyen +3Large Language Model BiasSteering

  43. Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection

    Aug 28, 2025Harethah Abu Shairah, Hasan Abed Al Kader Hammoud, George Turkiyyah +1Safety AlignmentLarge Language Model Alignment

  44. VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models

    Aug 11, 2025Mansi Phute, Ravikumar BalakrishnanSteering

  45. Model Directions, Not Words: Mechanistic Topic Models Using Sparse Autoencoders

    Jul 31, 2025Carolina Zheng, Nicolas Beltran-Velez, Sweta Karlekar +5Topic ModelingSteering

  46. Exploring Context-aware and LLM-driven Locomotion for Immersive Virtual Reality

    Apr 24, 2025Suleyman Ozdel, Kadir Burak Buldu, Enkelejda Kasneci +1Virtual RealityLocomotion