Safety Filtering

Momentum

24 papers in the last four weeks, up 118% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 111

All topics
CardsList
  1. Context-Conditioned Hamilton-Jacobi Reachability for Adaptive Safety Filtering

    Oct 6, 2026Ali Fuat Sahin, Yunus Yazoglu, John Talbot +3Reachability AnalysisAutonomous Driving Safety Evaluation

  2. Reading, Not Manipulating: Leveraging Router Logits for Multimodal Safety in MoE Vision-Language Models

    Oct 6, 2026Ziyuan Yang, Wenxuan Ding, Shangbin Feng +1Vision-Language ModelsSafety Filtering

  3. Multi-Link Safety Filtering for VLA Policies Around Moving Hazards

    Sep 30, 2026Yatharth Agarwal, Vijay RaghunathanRobot SafetySafety Filtering

  4. Adaptive Safety Filtering for Frozen ACC Policies via Conformal Residual Calibration

    Sep 28, 2026Zhiruo Zhou, Rigaudiere Z. Li, Chen Xiwen +3Safety-Critical ControlAutonomous Driving Safety Evaluation

  5. Predictive Semantic Safety: From Visual Physical Reasoning to Safety-Critical Control

    Sep 28, 2026Taekyung Kim, Salem Fradi, Yanning Dai +2Robotic ControlSafety-Critical Control

  6. When World Models Lie: Adaptive Safety Analysis Under Wrong Imaginations

    Sep 28, 2026John Cao, Somil BansalReachability AnalysisWorld Models for Robotics

  7. AdaGuard: An Adaptive Guard Model with User-defined Policies

    Sep 28, 2026Yunhao Feng, Yifan Ding, Yuxiang Xie +4LLM GuardrailsAI Agent Safety

  8. Safety Reconstructed: Generative Modeling via Masked Diffusion Builds Strong Safety Guardrails

    Sep 27, 2026Gert Lek, Abele Malan, Chaoyi Zhu +3LLM Safety BenchmarksLLM Guardrails

  9. CrossSafe: Towards Cross-Embodiment Latent Safety Filters

    Sep 24, 2026Ihab Tabbara, Yuxuan Yang, Hussein SibaiReachability AnalysisCross-Embodiment Robot Learning

  10. Turning Safety into Competence: Minimally Exploitable Robot Policies via Safety-Filtered Reinforcement Learning

    Sep 23, 2026Ruihan Wu, Rui Yang, Donggeon David Oh +2Sequential MARLRL for Robotics

  11. Can Data Attribution Filter Out Subliminal Learning? Not Reliably

    Sep 17, 2026Moritz Weckbecker, Sweta Jena, Jonas Müller +5Gradient-Based AttributionTraining Data Curation

  12. Runtime Safety Filtering for Two-Terminal Hazards in Robotic Battery Recycling

    Sep 17, 2026Yuxin Cao, Wei Song, Xianglin Yang +4Robot SafetySafety Filtering

  13. Safety Beyond the Interface: Detecting Harm via Latent States in Large Language Models

    Sep 16, 2026Alizishaan Khatri, Chiquita Prabhu, Omkar NeogiSafety FilteringLLM Safety

  14. Winning a Won Game: Strict Reach-Avoid-Stay Control Barrier Functions for High-Dimensional Black-Box Systems

    Sep 16, 2026Donggeon David Oh, Duy P. Nguyen, Gongkai Yuan +3Robotic ControlControl Barrier Functions

  15. ResSafe: Learning Safety Filtering with Residual Reinforcement Learning for Humanoids

    Sep 14, 2026Gechen Qu, Tong Zhang, Bike Zhang +4Safety-Critical ControlHumanoid Robot Control

  16. Exact Feasibility Certification and Optimal Responsibility Allocation for Multi-Robot CBF Safety Filters

    Sep 14, 2026Chandan Kumar Sah, Jishnu KeshavanSafety-Critical ControlControl Barrier Functions

  17. CS-Guard: Benchmarking LLM Guardrails for Code Generation Security

    Sep 9, 2026Jinyang Li, Mingyu Guo, Hung X. NguyenLLM GuardrailsAdversarial Attacks on LLMs

  18. Style Over Substance: Content-Invariant Wrappers Flip LLM Safety-Judge Verdicts

    Sep 8, 2026Yongxi Zhou, Wenbo Ye, Yuanzhe Liu +2LLM Safety BenchmarksLLM-as-a-Judge

  19. Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate

    Sep 1, 2026Kaiyan Wen, Shijie Zhang, Lu Yu +1Adversarial Attacks on VLMsMulti-Agent Debate