Safety Filtering

Momentum

24 papers in the last four weeks, up 118% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 111

All topics
CardsList
  1. kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail

    Jul 2, 2026Mahmoud Abdelfattah, Hamid Nasiri, Peter GarraghanLLM GuardrailsSafety Filtering

  2. Safe Alone, Unsafe Together: Safeguarding Against Implicit Toxicity When Benign Images Combine

    Jul 1, 2026Jiaxian Lv, Shiyao Cui, Yingkang Wang +3Toxicity DetectionSafety Filtering

  3. OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

    Jun 19, 2026Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai +2Adversarial Prompt GenerationAdversarial Attacks on LLMs

  4. OSGuard: A Benchmark for Safety in Computer-Use Agents

    Jun 13, 2026Mina Mohammadmirzaei, Jeffrey FlaniganComputer-Use AgentsLLM Guardrails

  5. Who Earns the Safety? Intervention-Aware Quantum Predictive Control with Safety Attribution

    Jun 8, 2026Yifan WangSafety-Critical ControlControl Barrier Functions

  6. Your Model Already Knows: Attention-Guided Safety Filter for Vision-Language-Action Models

    Jun 8, 2026Seongbin Park, Fan Zhang, Baharan Mirzasoleiman +2Robot SafetySafety Filtering

  7. Shield-Loco: Shielding Locomotion Policies with Predictive Safety Filtering

    Jun 5, 2026Aditya Shirwatkar, Sebastian Sanokowski, Shishir Kolathaya +2Robot SafetySafety Filtering

  8. Epistemic Injustice in Language Models: An Audit of Pretraining Filters and Guardrails

    Jun 4, 2026Marco Antonio Stranisci, A Pranav, Rossana Damiano +2LLM GuardrailsTraining Data Curation

  9. Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense

    Jun 4, 2026Minseok Choi, Seungbin Yang, Dongjin Kim +5LLM GuardrailsSafety Filtering

  10. SentGuard: Sentence-Level Streaming Guardrails for Large Language Models

    Jun 1, 2026Jiaqi Yu, Xin Wang, Yixu Wang +4Language Model Safety EvaluationLLM Guardrails

  11. Triaging Threats to Specialized Guardrails

    May 29, 2026Wenjie Jacky Mo, Xiaofei Wen, Rui Cai +6LLM Safety BenchmarksLLM Guardrails

  12. FinHarness: An Inline Lifecycle Safety Harness for Finance LLM Agents

    May 26, 2026Haoxuan Jia, Yang Liu, Bin Chong +10AI Agent ReliabilityLLM Guardrails

  13. Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection

    May 24, 2026Lixing Lin, Juli You, Yue Li +4Language Model Safety EvaluationLLM Guardrails

  14. Safety-Critical Control for Smoothed Implicit Contact Dynamics

    May 20, 2026Haegu Lee, Yitaek Kim, Christoffer SlothDynamical SystemsContact-Rich Robotic Manipulation

  15. RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

    May 20, 2026Lukas Weidener, Marko Brkić, Mihailo Jovanović +2LLM Safety BenchmarksLanguage Model Safety Evaluation

  16. Exploring and Developing a Pre-Model Safeguard with Draft Models

    May 19, 2026Hongyu Cai, Arjun Arunasalam, Yiming Liang +2LLM GuardrailsSafety Filtering

  17. Adversarial Stress Testing of SPARK Humanoid Safety Filters

    May 18, 2026Saurav Ghosh, Abdou Sow, Luke ZhangAdversarial RobustnessRobotics

  18. SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening

    May 17, 2026Shahriar Kabir Nahin, Hadi Askari, Muhao Chen +1Adaptive InferenceEfficient VLM Inference

  19. Policy Library CBF: Finite-Horizon Safety at Runtime via Parallel Rollouts

    May 15, 2026Taekyung Kim, Hideki Okamoto, Bardh Hoxha +2Safety-Critical ControlControl Barrier Functions