LLM Guardrails

LLM: Large Language Model

Momentum

15 papers in the last four weeks, up 36% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 138

All topics
CardsList
  1. Reflex-Guard: A Low-Latency Guardrail for LLM Prompt Safety Using Dense Semantic Embeddings

    Aug 18, 2026Istiaque Ahmed, Afia Anjum Borsha, Ranat Das Prangon +2LLM GuardrailsAdversarial Attacks on LLMs

  2. AI Guardrail Survival under Single-Cycle Agentic Self-Summarization

    Aug 11, 2026Ted Kwartler, Alan Aqrawi, Arian AbbasiLLM GuardrailsLLM Safety Evaluation

  3. ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

    Aug 11, 2026Xinzhe Huang, Biwu Yao, Kedong Xiu +4LLM GuardrailsLanguage Model Calibration

  4. HoloAegis: Frozen Representation, Topological Inference --- Minimally Parametric Safety Manifolds and Their Capability Boundaries for LLM Guardrails

    Aug 9, 2026Tak Ho Alex Li, Kaijie Liu, Lik-Hang Lee +3Language Model Safety EvaluationLLM Guardrails

  5. Yesterday's Shield, Today's Spear: A Self-Evolving Safety Guardrail in Production

    Aug 9, 2026Cong Ming, Jingyi Chen, Bin Liu +4Continual Learning for LLMsLLM Guardrails

  6. NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

    Aug 7, 2026Aditya Katkar, Om Karkele, Kartik Mandhane +2Tool-Augmented Language Model AgentsLLM Guardrails

  7. DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

    Aug 6, 2026Wenhao Lin, Chenyu Yu, Xingwei Lin +6LLM World ModelsLLM Guardrails

  8. LatentGuard: Efficient and Inspectable Latent Reasoning for LLM Safeguards

    Aug 4, 2026Zhinan Liu, Jie Li, Mingyu Kang +1LLM AuditingLLM Guardrails

  9. An Inline Control Architecture for Language Models in Intelligent Transportation Systems

    Aug 4, 2026Narendra Kumar Dewangan, Mounira MsahliLLM GuardrailsAdversarial Attacks on LLMs

  10. When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

    Aug 4, 2026Yu Feng, Chunting Zang, Chen Shen +4Language Model Safety EvaluationLLM Guardrails

  11. Auditable Release Control for Pedagogical Leakage in LLM Tutors

    Aug 1, 2026Nizam KadirLLM AuditingLLM Guardrails

  12. Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents

    Jul 31, 2026Minghui Pan, Jiayuxuan Yang, Yuanyuan Yuan +2LLM GuardrailsPrompt Injection Attacks on AI Agents

  13. Safeguards for Speech2Speech LLM-Assistants: A Case Study in Automotive Applications

    Jul 23, 2026Gregor Endler, Sebastian Kraus, Lukas StappenLanguage Model Safety EvaluationLLM Guardrails

  14. GuardianAgentBench: Where Agents Fail and How to Guard Them

    Jul 23, 2026Vishal Ishwar Naik, Chenyu Xu, Donna Dong +5AI Agent ReliabilityLLM Guardrails

  15. A Dual-Hypothesis Reasoning Framework for LLM Guardrails

    Jul 20, 2026Md Asiful Islam, Fahmida Alam, Mihai SurdeanuSupervised Fine-TuningLanguage Model Safety Evaluation

  16. SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing

    Jul 15, 2026Tianyu Chen, Chujia Hu, Wenjie WangLanguage Model Safety EvaluationLLM Guardrails

  17. Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B

    Jul 9, 2026Avi-ad Avraam BuskilaLLM Safety BenchmarksLanguage Model Safety Evaluation

  18. DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

    Jul 7, 2026He Liu, Changtao Miao, Xinjie Yang +12Reasoning DistillationLLM Guardrails

  19. Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

    Jul 2, 2026William Hackett, Peter GarraghanLLM AuditingLLM Guardrails

  20. HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

    Jul 2, 2026Navaneeth Sangameswaran, Preetham S, Ashmiya LeninLLM Safety BenchmarksLanguage Model Safety Evaluation

  21. kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail

    Jul 2, 2026Mahmoud Abdelfattah, Hamid Nasiri, Peter GarraghanLLM GuardrailsSafety Filtering

  22. SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing

    Jun 29, 2026Jiacheng Zhang, Haoyu He, Sen Zhang +5LLM Safety BenchmarksLanguage Model Safety Evaluation