Hidden-State Probing

Momentum

4 papers in the last four weeks, up 33% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 36

All topics
CardsList
  1. Alignment via Training Against Probes Without Losing Monitorability

    Sep 29, 2026Lena Libon, Alexander Panfilov, Ben Rank +3Fine-TuningLLM Safety Alignment

  2. Finite Probes Suffice: Identifiability and Universality for Weight-Space Learning

    Sep 27, 2026Soutrik Sarangi, Yonatan Sverdlov, Adir Dayan +2Hidden-State Probing

  3. Decodability is Not Causality: Dissociating Probe Readouts from Behavioral Drivers via SAE Decomposition

    Sep 16, 2026Devesh Tiwari, Camille Davis, Shivank Sinha +3Causal Interventions in Language ModelsHidden-State Probing

  4. Probing and steering biology across Boltz-1s trunk-diffusion boundary

    Aug 11, 2026Piotr Jedryszek, Tongmeng Xie, Adam Winnifrith +5Protein Structure PredictionActivation Steering

  5. Probe, Don't Prompt: A Hidden-State Probe for Metadata Filtering in Multi-Meta-RAG

    Jul 4, 2026Mykhailo Poliakov, Nadiya ShvaiRetrieval-Augmented GenerationLLM Information Extraction

  6. Aionoscope: Debugging Latent-State Accessibility in Time-Series Representations

    Jul 1, 2026Alexander Chemeris, Ming Jin, Randall BalestrieroSynthetic Benchmark GenerationTime Series Representation Learning

  7. Event-Conditioned Diagnostics of Kinematic, Contact, and Object-Permanence Fields in Passive Object-State World Models

    Jun 26, 2026Yang Liu, Yuming ChenLatent Dynamics ModelingLatent World Models

  8. When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

    Jun 22, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangAI Agent EvaluationIndirect Prompt Injection

  9. Now You (Still) See Me: Detecting Evasive Steganographic Payloads in LLMs

    Jun 8, 2026Charles Westphal, Timothy Douglas, Keivan Navaie +2LLM Backdoor AttacksAdversarial Attacks on LLMs

  10. PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization

    May 18, 2026Wonjoong Kim, Yeonjun In, Sangwu Park +2Reward ModelingCredit Assignment in RL