LLM Guardrails

LLM: Large Language Model

Momentum

15 papers in the last four weeks, up 36% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 138

All topics
CardsList
  1. EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents

    May 29, 2026Dongwook Choi, Taeyoon Kwon, Bogyung Jeong +6LLM GuardrailsAI Agent Safety

  2. Triaging Threats to Specialized Guardrails

    May 29, 2026Wenjie Jacky Mo, Xiaofei Wen, Rui Cai +6LLM Safety BenchmarksLLM Guardrails

  3. FinGuard: Detecting Financial Regulatory Non-Compliance in LLM Interactions

    May 28, 2026Huaixia Dou, Jie Zhu, Minghao Wu +5Language Model Safety EvaluationLLM Guardrails

  4. Provably Secure Agent Guardrail

    May 28, 2026Benlong Wu, Weiming Zhang, Kejiang Chen +2LLM GuardrailsAI Agent Security

  5. Robust and Efficient Guardrails with Latent Reasoning

    May 27, 2026Siddharth Sai, Xiaofei Wen, Muhao ChenLLM GuardrailsContent Moderation

  6. The Ethics of LLM Sandbox and Persona Dynamics

    May 27, 2026Tim Gebbie, Stewart GebbieLLM GuardrailsLLM Safety Alignment

  7. FinHarness: An Inline Lifecycle Safety Harness for Finance LLM Agents

    May 26, 2026Haoxuan Jia, Yang Liu, Bin Chong +10AI Agent ReliabilityLLM Guardrails

  8. When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries

    May 26, 2026Yige Li, Jun Sun, Wei Zhao +5LLM Safety BenchmarksHealthcare

  9. AI Content Moderation in Therapy Conversations

    May 25, 2026Jiwon Kim, Claire Wang, Taeung Yoon +2LLM AuditingLLM Guardrails

  10. Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection

    May 24, 2026Lixing Lin, Juli You, Yue Li +4Language Model Safety EvaluationLLM Guardrails

  11. CR4T: Rewrite-Based Guardrails for Adolescent LLM Safety

    May 20, 2026Heajun An, Qi Zhang, Vedanth Achanta +1LLM GuardrailsLLM Safety Alignment

  12. Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs

    May 20, 2026Dylan Feng, Pragya Srivastava, Anca Dragan +1Language Model Safety EvaluationLLM Guardrails

  13. Governance by Construction for Generalist Agents

    May 20, 2026Segev Shlomov, Iftach Shoham, Alon Oved +7LLM GuardrailsAI Agent Governance

  14. Robotics-Inspired Guardrails for Foundation Models in Socially Sensitive Domains

    May 19, 2026Rebecca Ramnauth, Drazen Brscic, Brian ScassellatiLLM GuardrailsHuman-AI Interaction

  15. Exploring and Developing a Pre-Model Safeguard with Draft Models

    May 19, 2026Hongyu Cai, Arjun Arunasalam, Yiming Liang +2LLM GuardrailsSafety Filtering

  16. Position: A Three-Layer Probabilistic Assume-Guarantee Architecture Is Structurally Required for Safe LLM Agent Deployment

    May 18, 2026S. Bensalem, Y. Dong, M. Franzle +6AI Agent ReliabilityLLM Guardrails

  17. LiSA: Lifelong Safety Adaptation via Conservative Policy Induction

    May 14, 2026Minbeom Kim, Lesly Miculicich, Bhavana Dalvi Mishra +6Continual Learning for LLM AgentsLLM Guardrails

  18. AERIC: Anticipatory Hidden-State Monitoring for Implicit Harmful Dialogue

    May 13, 2026Jihyung Park, Saleh Afroogh, Junfeng JiaoLanguage Model Safety EvaluationLLM Guardrails

  19. LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs

    May 13, 2026Rodrigo Nogueira, Thales Sales Almeida, Giovana Kerche Bonás +7Adversarial Prompt GenerationLLM Guardrails

  20. No Attack Required: Semantic Fuzzing for Specification Violations in Agent Skills

    May 13, 2026Ying Li, Hongbo Wen, Yanju Chen +3LLM GuardrailsLLM Agent Verification

  21. Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers

    May 11, 2026Nikita Kezins, Urbas Ekka, Pascal Berrang +1Neural Network VerificationLanguage Model Safety Evaluation

  22. GLiGuard: Schema-Conditioned Classification for LLM Safeguard

    May 8, 2026Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney +1LLM GuardrailsText Classification

  23. LLM Wardens: Mitigating Adversarial Persuasion with Third-Party Conversational Oversight

    May 8, 2026Lennart Wachowiak, Scott D. Blain, David Williams-King +1LLM GuardrailsLLM Safety

  24. SafeHarbor: Hierarchical Memory-Augmented Guardrail for LLM Agent Safety

    May 7, 2026Zhe Liu, Zonghao Ying, Wenxin Zhang +5LLM GuardrailsLLM Agent Security

  25. One Turn Too Late: Learning When to Intervene Against Multi-Turn Malicious Intent

    May 7, 2026Xinjie Shen, Rongzhe Wei, Peizhi Niu +6Language Model Safety EvaluationLLM Guardrails

  26. Who Decides What Is Harmful? Content Moderation Policy Through A Multi-Agent Personalised Inference Framework

    May 2, 2026Ewelina Gajewska, Michal Wawer, Katarzyna Budzynska +1LLM GuardrailsContent Moderation

  27. BabelSafe: A Policy-Grounded Multilingual Safety Benchmark for LLMs

    May 1, 2026Yunhan Zhao, Zhaorun Chen, Xingjun Ma +1LLM Safety BenchmarksMultilingual Language Models