Safety Filtering

Momentum

24 papers in the last four weeks, up 118% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 111

All topics
CardsList
  1. Influence Is Not Authority: When Causal Guardrail Signals Make Legitimate Tool Use Look Like an Attack in Tool-Using LLM Agents

    Aug 30, 2026Tanzim Ahad, Ismail Hossain, Md Jahangir Alam +3LLM GuardrailsLLM Agent Security

  2. Reflex-Guard: A Low-Latency Guardrail for LLM Prompt Safety Using Dense Semantic Embeddings

    Aug 18, 2026Istiaque Ahmed, Afia Anjum Borsha, Ranat Das Prangon +2LLM GuardrailsAdversarial Attacks on LLMs

  3. Robust Safety Filtering for Input-Constrained Underactuated Linear Systems

    Aug 11, 2026Muhamad Rausyan FikriSafety-Critical ControlControl Barrier Functions

  4. ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

    Aug 11, 2026Xinzhe Huang, Biwu Yao, Kedong Xiu +4LLM GuardrailsLanguage Model Calibration

  5. Measuring the Wrong Thing: Internal Harmfulness Scores Anti-Rank Successful Jailbreaks

    Aug 10, 2026Mingyu Luo, Ming Deng, Zilang Qiu +8Safety FilteringLLM Jailbreak Attacks

  6. Yesterday's Shield, Today's Spear: A Self-Evolving Safety Guardrail in Production

    Aug 9, 2026Cong Ming, Jingyi Chen, Bin Liu +4Continual Learning for LLMsLLM Guardrails

  7. NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

    Aug 7, 2026Aditya Katkar, Om Karkele, Kartik Mandhane +2Tool-Augmented Language Model AgentsLLM Guardrails

  8. When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

    Aug 4, 2026Yu Feng, Chunting Zang, Chen Shen +4Language Model Safety EvaluationLLM Guardrails

  9. Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

    Aug 3, 2026Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel +1Language Model Safety EvaluationLLM Safety Alignment

  10. Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems

    Aug 2, 2026Wanguang Li, Zhaoxin Wang, Handing WangAdversarial Prompt GenerationT2I Generation

  11. Towards General Language-Conditioned Latent Safety Filters

    Jul 31, 2026Ihab Tabbara, Yuxuan Yang, Hussein SibaiRobotic ControlRobot Safety

  12. Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

    Jul 30, 2026Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji +2Multimodal RobustnessAdversarial Attacks

  13. Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

    Jul 30, 2026Pingyu Wu, Lingyao Zhu, Weiming Zhang +1Adversarial Attacks on LLMsSafety Filtering

  14. RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation

    Jul 29, 2026Benyamin Tafreshian, Prathamesh DhakeAdversarial AttacksAdversarial Attacks on LLMs

  15. Shieldstral

    Jul 28, 2026Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli +273Language Model Safety EvaluationContent Moderation

  16. Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

    Jul 27, 2026Xinnuo Xu, Anja Thieme, Daniela Massiceti +6T2I GenerationSafe T2I Generation

  17. SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing

    Jul 15, 2026Tianyu Chen, Chujia Hu, Wenjie WangLanguage Model Safety EvaluationLLM Guardrails

  18. NetInjectBench: Benchmarking Indirect Prompt Injection in Tool-Using Large Language Model Agents for Network Operations

    Jul 11, 2026Ruksat Khan Shayoni, Muhammad Faraz Shoaib, S M Asif Hossain +1AI Agent Security BenchmarksIndirect Prompt Injection

  19. Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation

    Jul 10, 2026Alex Zongo, Peng WeiCollision AvoidanceSafety Filtering

  20. DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

    Jul 7, 2026He Liu, Changtao Miao, Xinjie Yang +12Reasoning DistillationLLM Guardrails

  21. Evaluating calibrated refusal and safe usefulness in dual-use biology settings

    Jul 6, 2026Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis +13LLM Refusal BehaviorSafety Filtering

  22. Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

    Jul 2, 2026William Hackett, Peter GarraghanLLM AuditingLLM Guardrails

  23. HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

    Jul 2, 2026Navaneeth Sangameswaran, Preetham S, Ashmiya LeninLLM Safety BenchmarksLanguage Model Safety Evaluation