Runtime Safety Filtering

Momentum

4 papers in the last four weeks, down 20% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 33

All topics
CardsList
  1. Instrumental Monitor Evasion Emerges Under Ordinary Task Pressure

    Sep 24, 2026David Schmotz, Derck Prinzhorn, Luca Beurer-Kellner +3Runtime Safety FilteringEvasion

  2. ClashBench: Conflicts Leading Agents to Seize and Harm

    Sep 17, 2026Yuejin Xie, Yu Li, Dadi Guo +6Runtime Safety FilteringPreemption

  3. Runtime Safety Filtering for Two-Terminal Hazards in Robotic Battery Recycling

    Sep 17, 2026Yuxin Cao, Wei Song, Xianglin Yang +4Safety FiltersRuntime Safety Filtering

  4. Semantic-TVM: Structure-Preserving Trustworthy Virtual Memory for Memory-Augmented and Tool-Using Agents

    Sep 14, 2026Yu Li, Qikun Cai, Tao Huang +1Peak MemoryUntrusted Content

  5. Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents

    Sep 1, 2026Xiaofang Yang, Ziqi Miao, Dianbo Sui +2Runtime Safety FilteringMalicious Agents

  6. The Irreversibility Budget: Fleet-Level Risk Accounting and Admission Control for Agent Operating Systems

    Aug 31, 2026Bardia Mohammadi, Laurent BindschaedlerRuntime Safety FilteringAgentic Deployments

  7. Beyond Handcrafted Security: Towards Self-Evolving Defense for LLM Agents

    Aug 13, 2026Jiajun Ruan, Peiyang Li, Yukun Chen +2Runtime Safety FilteringLarge Language Model Agents

  8. Dual Stress: Runtime Safety Monitoring for Safety-Constrained MPC Navigation

    Aug 11, 2026Jamil Chahine, Wenqi Cai, John Abanes +1Safety ConstraintsModel Predictive Control

  9. DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

    Aug 6, 2026Wenhao Lin, Chenyu Yu, Xingwei Lin +6Runtime Safety FilteringLarge Language Model Agents

  10. ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consistency

    Jul 31, 2026Wenda Yu, Tianshi Wang, Fengling Li +3Robotic ManipulationRuntime Safety Filtering

  11. Democratizing Agent Deployment Safety: A Structural Monitoring Approach

    Jul 16, 2026Preeti Ravindra, Rahul Tiwari, Vincent WolowskiAgentic DeploymentsSecurity Evaluation

  12. Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation

    Jul 10, 2026Alex Zongo, Peng WeiMulti-UavSafety Filters

  13. Token-Flow Firewall: Semantic Runtime Auditing for Persistent AI Agents

    Jul 9, 2026Puji Wang, Yingchen Zhang, Ruqing Zhang +2Agentic DeploymentsSemantic Firewall

  14. EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

    Jun 30, 2026Siddhant Panpatil, Arth Singh, Mijin Koo +3Safety BenchmarksEgocentric Video

  15. LabGuard: Grounding Natural-Language Laboratory Rules into Runtime Guards for Embodied Laboratory Agents

    Jun 30, 2026Jingpu Yang, Fengxian Ji, Zhengzhao Lai +8Runtime Safety FilteringLaboratory

  16. Mostly Automatic Translation of Language Interpreters from C to Safe Rust

    Jun 25, 2026Bo Wang, Brandon Paulsen, Joey Dodds +3Program AnalysisRuntime Safety Filtering

  17. RedAct: Redacting Agent Capability Traces for Procedural Skill Protection

    Jun 9, 2026Shuwen Xu, Zhitao He, Yi R. FungTracesData Leakage

  18. Agent libOS: A Runtime Substrate for Capability-Controlled Self-Evolving LLM Agents

    Jun 2, 2026Yingqi ZhangLarge Language Model AgentsRuntime Safety Filtering

  19. GNMR: Runtime Stability Control for Low-Precision Large Language Model Training

    May 30, 2026Boao Kong, Weichen Jia, Engao Zhang +6Large Language Model TrainingFull-Precision Performance

  20. AIRGuard: Guarding Agent Actions with Runtime Authority Control

    May 27, 2026Suliu Qin, Haomin Zhuang, Yujun Zhou +2AuthorizationRuntime Safety Filtering

  21. PragLocker: Protecting Agent Intellectual Property in Untrusted Deployments via Non-Portable Prompts

    May 7, 2026Qinfeng Li, Yuntai Bao, Jianghui Hu +5Untrusted ContentPrompt Engineering

  22. SafeAgent: A Runtime Protection Architecture for Agentic Systems

    Apr 19, 2026Hailin Liu, Eugene Ilyushin, Jie Ni +1Runtime Safety FilteringLarge Language Model Safety

  23. LinuxArena: A Control Setting for AI Agents in Live Production Software Environments

    Apr 16, 2026Tyler Tracy, Ram Potham, Nick Kuhn +31SabotageRuntime Safety Filtering