Model Activations

Recent momentum

-71%

6 papers in the last 28 days · 0.2% of indexed attention

Twelve weeks of publication activity for this topic as it is defined today.

Weekly history

Recent digests

What was published in this topic, kept on the site without email delivery.

Period ending 2026-09-14

3 new papers

A weekly snapshot of new work published in Model Activations.

Period ending 2026-09-07

5 new papers

A weekly snapshot of new work published in Model Activations.

162 papers

Latest in Model Activations

Open your feed →
CardsList
  1. LLM Layers Immediately Correct Each Other

    Sep 7, 2026Arjun Patrawala, Jiahai Feng, Erik Jones +1Model ActivationsResidual Stream

  2. GAPS: Dimension-Level Gates for Conditional Activation Steering

    Sep 1, 2026Moghis Fereidouni, Muhammad Umair Haider, Hassan Sajjad +1Linear Activation SteeringModel Activations

  3. Interpreting Language Model Hidden States at Scale

    Aug 10, 2026Jordan Pettyjohn, Mansi Sakarvadia, Nathaniel Hudson +3Large Language Model ScaleModel Activations

  4. Looking in the Mirror: Introspecting Side-Effect Misalignments Induced by Fine-Tuning

    Aug 5, 2026Kotaro Yoshida, Laura Gomezjurado Gonzalez, Yukinori Yamamoto +3MisalignmentSide Effects

  5. Forecasting Side Effects of Activation Steering

    Jul 28, 2026Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang +1Linear Activation SteeringActivation Steering

  6. Conditional Optimal Bridge for Riemannian Activation Steering

    Jul 12, 2026Seyed Arshan Dalili, Ajay Narayanan Sridhar, Vijaykrishnan Narayanan +1Linear Activation SteeringActivation Steering

  7. Distributed Sparse Interventions in Language Models

    Jul 8, 2026Maximilian S. Ernst, Lorenz Linhardt, Aaron Peikert +1Causal InterventionProtein Language Model

  8. Mechanistically Eliciting Latent Behaviors in Language Models

    Jun 28, 2026Andrew Mack, Nina Panickssery, Alexander Matt TurnerModel ActivationsAI Behavior Analysis