LLM Guardrails

LLM: Large Language Model

Momentum

15 papers in the last four weeks, up 36% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 138

All topics
CardsList
  1. A Deterministic Control Plane for LLM Coding Agents

    Jun 25, 2026Padmaraj MadathaAI Coding AgentsLLM Guardrails

  2. MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction

    Jun 24, 2026Congbo Ma, Hu Wang, Yichun Zhang +1LLM GuardrailsLLM Safety

  3. AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming

    Jun 23, 2026Pingchuan Ma, Zhaoyu Wang, Zimo Ji +5LLM GuardrailsProgram Synthesis

  4. A Layered Security Framework Against Prompt Injection in RAG-Based Chatbots

    Jun 17, 2026Gulshan Saleem, Nisar Ahmed, Muhammad Imran Zaman +1LLM GuardrailsIndirect Prompt Injection

  5. CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

    Jun 13, 2026Wenbo Yu, Bohua Wang, Hao Fang +10LLM Safety BenchmarksLanguage Model Safety Evaluation

  6. OSGuard: A Benchmark for Safety in Computer-Use Agents

    Jun 13, 2026Mina Mohammadmirzaei, Jeffrey FlaniganComputer-Use AgentsLLM Guardrails

  7. From Shield to Target: Denial-of-Service Attacks on LLM-Based Agent Guardrails

    Jun 12, 2026Yuguang Zhou, Xunguang Wang, Pingchuan Ma +3LLM GuardrailsAdversarial Attacks on LLMs

  8. BELLS-O: Evaluating the Operational Trade-offs of LLM Supervision Systems

    Jun 12, 2026Leonhard Waibl, Felix Michalak, Hadrien MariacciaLLM Safety BenchmarksLLM Guardrails

  9. A Safety-First Gateway Architecture for Trusted Public Health Resource Navigation

    Jun 11, 2026Ben Torkian, Jun ZhouLLM GuardrailsLLM Safety

  10. Carolina Guide: A Multi-Agent RAG System with Institutional Guardrails for Academic Policy Assistance

    Jun 11, 2026Ben Torsion, Jun ZhouMulti-Agent LLM SystemsLLM Guardrails

  11. FreoStream:Enhancing Stream Guardrails via Future-Aware Reasoning and Safety-Aligned Optimization

    Jun 11, 2026Jianwei Wang, Guoyang Shen, Yanhong Wu +5LLM GuardrailsOver-Refusal

  12. Deployment-Centered Evaluation: Predicting Query-Level Rejection Risk in a Clinical LLM System

    Jun 10, 2026Alyssa Unell, Miguel Fuentes, Brenna Li +4LLM GuardrailsClinical Language Model Evaluation

  13. Epistemic Injustice in Language Models: An Audit of Pretraining Filters and Guardrails

    Jun 4, 2026Marco Antonio Stranisci, A Pranav, Rossana Damiano +2LLM GuardrailsTraining Data Curation

  14. From Risk Classification to Action Plan Remediation: A Guardrail Feedback Driven Framework for LLM Agents

    Jun 4, 2026Yuhao Sun, Jiacheng Zhang, Shaanan Cohney +3LLM GuardrailsLLM Agent Training

  15. Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense

    Jun 4, 2026Minseok Choi, Seungbin Yang, Dongjin Kim +5LLM GuardrailsSafety Filtering

  16. GuardNet: Ensemble Strategies of Shallow Neural Networks for Robust Prompt Injection and Jailbreak Detection

    Jun 4, 2026Paulo Ricardo Ferreira Neves, Edson Rodrigues da Cruz Filho, Paulo Henrique Eleuterio Falsetti +7LLM GuardrailsNeural Network Robustness

  17. DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair

    Jun 2, 2026Qinyan Zhou, Peixin Zhang, Jun Sun +2LLM GuardrailsLLM Refusal Behavior

  18. SentGuard: Sentence-Level Streaming Guardrails for Large Language Models

    Jun 1, 2026Jiaqi Yu, Xin Wang, Yixu Wang +4Language Model Safety EvaluationLLM Guardrails

  19. BraveGuard: From Open-World Threats to Safer Computer-Use Agents

    May 31, 2026Yunhao Feng, Xiaohu Du, Xinhao Deng +13LLM GuardrailsAI Agent Safety

  20. D-Judge: Disrupting Multi-Turn Jailbreaks using Semantics-Preserving Output Rewriting

    May 31, 2026Huanli Gong, Zhipeng Wei, Yu Fu +4LLM GuardrailsMulti-Turn Jailbreak Attacks

  21. ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails

    May 29, 2026Yan Wang, Zhixuan Chu, Zihao Xue +9LLM GuardrailsLLM Safety Alignment