Representation Engineering

Momentum

0 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 12

All topics
CardsList
  1. Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models

    Sep 2, 2026Tianqi Xiao, Shiyao Cui, Minghao Zhang +2Multimodal Large Language ModelsRepresentation Engineering

  2. Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering

    Jul 28, 2026Maria Rosaria Briglia, Igor Maljkovic, Antonio Emanuele Cinà +3Adversarial Attacks on VLMsRepresentation Engineering

  3. LoRA for Gender-Inclusive Rewriting and Activation Steering for Counter-Narrative Generation

    Jul 25, 2026Akhil Rajeev P, Manoj Balaji JGender Bias in Language ModelsLanguage Model Steering

  4. Pulling The REINS: Training-Free Safety Alignment of Video Diffusion Models via Representation Steering

    Jun 15, 2026Rohit Kundu, Arindam Dutta, Sarosij Bose +2Diffusion Model AlignmentVideo Diffusion Models

  5. Whisper Hallucination Detection and Mitigation via Hidden Representation Steering and Sparse AutoEncoders

    Jun 5, 2026Georgii Aparin, Vadim Popov, Tasnima Sadekova +1Audio-Language Model Hallucination DetectionSparse Autoencoders

  6. Towards the Readability of LLM-Generated Codes through Multitask Representation Engineering

    Jun 4, 2026Huifan Gao, Liuhua He, Yinghui Pan +4Language Model SteeringRepresentation Engineering

  7. HARVE: Hacking-Aware Reward-Head Vector Editing for Robust Reward Models

    Jun 2, 2026Shuang Liu, Yuxuan Bo, Qiuyang Zhao +4Reward ModelingReward Hacking

  8. REED: Post-Training Representation Editing for Cross-Domain Linguistic Steganalysis

    May 27, 2026Ruohan Lei, Jianxin Gao, Wanli Peng +1Cross-Domain GeneralizationRepresentation Engineering

  9. SwordBench: Evaluating Orthogonality of Steering Image Representations

    May 10, 2026Vladimir Zaigrajew, Dawid Pludowski, Hubert Baniecki +1Vision Foundation ModelsRepresentation Engineering

  10. Knowledge Vector of Logical Reasoning in Large Language Models

    Apr 26, 2026Zixuan Wang, Yuanyuan LeiLLM InterpretabilityRepresentation Engineering

  11. Pref-CTRL: Preference Driven LLM Alignment using Representation Editing

    Apr 26, 2026Imranul Ashrafi, Inigo Jauregi Unanue, Massimo PiccardiLLM AlignmentRepresentation Engineering

  12. Beyond Forgetting: Representation Misdirection Elicits Controllable Side Behaviors and Capabilities

    Jan 29, 2026Tien Dang, The-Hai Nguyen, Dinh Mai Phuong +5Linear Representation HypothesisControllable Text Generation