Safety Filtering

Momentum

24 papers in the last four weeks, up 118% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 111

All topics
CardsList
  1. Context-Conditioned Hamilton-Jacobi Reachability for Adaptive Safety Filtering

    Oct 6, 2026Ali Fuat Sahin, Yunus Yazoglu, John Talbot +3Reachability AnalysisAutonomous Driving Safety Evaluation

  2. Reading, Not Manipulating: Leveraging Router Logits for Multimodal Safety in MoE Vision-Language Models

    Oct 6, 2026Ziyuan Yang, Wenxuan Ding, Shangbin Feng +1Vision-Language ModelsSafety Filtering

  3. Multi-Link Safety Filtering for VLA Policies Around Moving Hazards

    Sep 30, 2026Yatharth Agarwal, Vijay RaghunathanRobot SafetySafety Filtering

  4. Adaptive Safety Filtering for Frozen ACC Policies via Conformal Residual Calibration

    Sep 28, 2026Zhiruo Zhou, Rigaudiere Z. Li, Chen Xiwen +3Safety-Critical ControlAutonomous Driving Safety Evaluation

  5. Predictive Semantic Safety: From Visual Physical Reasoning to Safety-Critical Control

    Sep 28, 2026Taekyung Kim, Salem Fradi, Yanning Dai +2Robotic ControlSafety-Critical Control

  6. When World Models Lie: Adaptive Safety Analysis Under Wrong Imaginations

    Sep 28, 2026John Cao, Somil BansalReachability AnalysisWorld Models for Robotics

  7. AdaGuard: An Adaptive Guard Model with User-defined Policies

    Sep 28, 2026Yunhao Feng, Yifan Ding, Yuxiang Xie +4LLM GuardrailsAI Agent Safety

  8. Safety Reconstructed: Generative Modeling via Masked Diffusion Builds Strong Safety Guardrails

    Sep 27, 2026Gert Lek, Abele Malan, Chaoyi Zhu +3LLM Safety BenchmarksLLM Guardrails

  9. CrossSafe: Towards Cross-Embodiment Latent Safety Filters

    Sep 24, 2026Ihab Tabbara, Yuxuan Yang, Hussein SibaiReachability AnalysisCross-Embodiment Robot Learning

  10. Turning Safety into Competence: Minimally Exploitable Robot Policies via Safety-Filtered Reinforcement Learning

    Sep 23, 2026Ruihan Wu, Rui Yang, Donggeon David Oh +2Sequential MARLRL for Robotics

  11. Can Data Attribution Filter Out Subliminal Learning? Not Reliably

    Sep 17, 2026Moritz Weckbecker, Sweta Jena, Jonas Müller +5Gradient-Based AttributionTraining Data Curation

  12. Runtime Safety Filtering for Two-Terminal Hazards in Robotic Battery Recycling

    Sep 17, 2026Yuxin Cao, Wei Song, Xianglin Yang +4Robot SafetySafety Filtering

  13. Safety Beyond the Interface: Detecting Harm via Latent States in Large Language Models

    Sep 16, 2026Alizishaan Khatri, Chiquita Prabhu, Omkar NeogiSafety FilteringLLM Safety

  14. Winning a Won Game: Strict Reach-Avoid-Stay Control Barrier Functions for High-Dimensional Black-Box Systems

    Sep 16, 2026Donggeon David Oh, Duy P. Nguyen, Gongkai Yuan +3Robotic ControlControl Barrier Functions

  15. ResSafe: Learning Safety Filtering with Residual Reinforcement Learning for Humanoids

    Sep 14, 2026Gechen Qu, Tong Zhang, Bike Zhang +4Safety-Critical ControlHumanoid Robot Control

  16. Exact Feasibility Certification and Optimal Responsibility Allocation for Multi-Robot CBF Safety Filters

    Sep 14, 2026Chandan Kumar Sah, Jishnu KeshavanSafety-Critical ControlControl Barrier Functions

  17. CS-Guard: Benchmarking LLM Guardrails for Code Generation Security

    Sep 9, 2026Jinyang Li, Mingyu Guo, Hung X. NguyenLLM GuardrailsAdversarial Attacks on LLMs

  18. Style Over Substance: Content-Invariant Wrappers Flip LLM Safety-Judge Verdicts

    Sep 8, 2026Yongxi Zhou, Wenbo Ye, Yuanzhe Liu +2LLM Safety BenchmarksLLM-as-a-Judge

  19. Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate

    Sep 1, 2026Kaiyan Wen, Shijie Zhang, Lu Yu +1Adversarial Attacks on VLMsMulti-Agent Debate

  20. Influence Is Not Authority: When Causal Guardrail Signals Make Legitimate Tool Use Look Like an Attack in Tool-Using LLM Agents

    Aug 30, 2026Tanzim Ahad, Ismail Hossain, Md Jahangir Alam +3LLM GuardrailsLLM Agent Security

  21. Reflex-Guard: A Low-Latency Guardrail for LLM Prompt Safety Using Dense Semantic Embeddings

    Aug 18, 2026Istiaque Ahmed, Afia Anjum Borsha, Ranat Das Prangon +2LLM GuardrailsAdversarial Attacks on LLMs

  22. Robust Safety Filtering for Input-Constrained Underactuated Linear Systems

    Aug 11, 2026Muhamad Rausyan FikriSafety-Critical ControlControl Barrier Functions

  23. ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

    Aug 11, 2026Xinzhe Huang, Biwu Yao, Kedong Xiu +4LLM GuardrailsLanguage Model Calibration

  24. Measuring the Wrong Thing: Internal Harmfulness Scores Anti-Rank Successful Jailbreaks

    Aug 10, 2026Mingyu Luo, Ming Deng, Zilang Qiu +8Safety FilteringLLM Jailbreak Attacks

  25. Yesterday's Shield, Today's Spear: A Self-Evolving Safety Guardrail in Production

    Aug 9, 2026Cong Ming, Jingyi Chen, Bin Liu +4Continual Learning for LLMsLLM Guardrails

  26. NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

    Aug 7, 2026Aditya Katkar, Om Karkele, Kartik Mandhane +2Tool-Augmented Language Model AgentsLLM Guardrails

  27. When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

    Aug 4, 2026Yu Feng, Chunting Zang, Chen Shen +4Language Model Safety EvaluationLLM Guardrails

  28. Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

    Aug 3, 2026Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel +1Language Model Safety EvaluationLLM Safety Alignment

  29. Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems

    Aug 2, 2026Wanguang Li, Zhaoxin Wang, Handing WangAdversarial Prompt GenerationT2I Generation

  30. Towards General Language-Conditioned Latent Safety Filters

    Jul 31, 2026Ihab Tabbara, Yuxuan Yang, Hussein SibaiRobotic ControlRobot Safety

  31. Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

    Jul 30, 2026Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji +2Multimodal RobustnessAdversarial Attacks

  32. Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

    Jul 30, 2026Pingyu Wu, Lingyao Zhu, Weiming Zhang +1Adversarial Attacks on LLMsSafety Filtering

  33. RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation

    Jul 29, 2026Benyamin Tafreshian, Prathamesh DhakeAdversarial AttacksAdversarial Attacks on LLMs

  34. Shieldstral

    Jul 28, 2026Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli +273Language Model Safety EvaluationContent Moderation

  35. Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

    Jul 27, 2026Xinnuo Xu, Anja Thieme, Daniela Massiceti +6T2I GenerationSafe T2I Generation

  36. SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing

    Jul 15, 2026Tianyu Chen, Chujia Hu, Wenjie WangLanguage Model Safety EvaluationLLM Guardrails

  37. NetInjectBench: Benchmarking Indirect Prompt Injection in Tool-Using Large Language Model Agents for Network Operations

    Jul 11, 2026Ruksat Khan Shayoni, Muhammad Faraz Shoaib, S M Asif Hossain +1AI Agent Security BenchmarksIndirect Prompt Injection

  38. Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation

    Jul 10, 2026Alex Zongo, Peng WeiCollision AvoidanceSafety Filtering

  39. DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

    Jul 7, 2026He Liu, Changtao Miao, Xinjie Yang +12Reasoning DistillationLLM Guardrails

  40. Evaluating calibrated refusal and safe usefulness in dual-use biology settings

    Jul 6, 2026Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis +13LLM Refusal BehaviorSafety Filtering

  41. Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

    Jul 2, 2026William Hackett, Peter GarraghanLLM AuditingLLM Guardrails

  42. HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

    Jul 2, 2026Navaneeth Sangameswaran, Preetham S, Ashmiya LeninLLM Safety BenchmarksLanguage Model Safety Evaluation