LLM Guardrails

LLM: Large Language Model

Momentum

15 papers in the last four weeks, up 36% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 138

All topics
CardsList
  1. Safeguarding LLM Agents from Misalignment through Provenance Analysis

    May 1, 2026Yining She, Yiliang Liang, Eunsuk KangLLM GuardrailsLLM Agent Safety

  2. A Comparative Evaluation of AI Agent Security Guardrails

    Apr 27, 2026Qi Li, Jiu Li, Pingtao Wei +8LLM GuardrailsAI Agent Security

  3. UNSEEN: A Cross-Stack LLM Unlearning Defense against AR-LLM Social Engineering Attacks

    Apr 25, 2026Tianlong Yu, Yang Yang, Xiao Luo +6Privacy-Preserving Language ModelsLLM Guardrails

  4. Shift-Up: A Framework for Software Engineering Guardrails in AI-native Software Development -- Initial Findings

    Apr 22, 2026Petrus Lipsanen, Liisa Rannikko, François Christophe +3Software Engineering AgentsLLM Guardrails

  5. SafeRedirect: Defeating Internal Safety Collapse via Task-Completion Redirection in Frontier LLMs

    Apr 22, 2026Chao Pan, Yu Wu, Xin YaoLLM GuardrailsLLM Safety Alignment

  6. LLM Safety From Within: Detecting Harmful Content with Internal Representations

    Apr 20, 2026Difan Jiao, Yilun Liu, Ye Yuan +4Language Model Safety EvaluationLLM Guardrails

  7. TWGuard: A Case Study of LLM Safety Guardrails for Localized Linguistic Contexts

    Apr 17, 2026Hua-Rong Chu, Kuan-Chun Wang, Yao-Te HuangLanguage Model Safety EvaluationLLM Guardrails

  8. Proof-of-Guardrail in AI Agents and What (Not) to Trust from It

    Mar 6, 2026Xisen Jin, Michael Duan, Qin Lin +4LLM GuardrailsRemote Attestation

  9. StepShield: When, Not Whether to Intervene on Rogue Agents

    Jan 29, 2026Gloria Felicia, Zitha Sasindran, Jinfeng He +3LLM GuardrailsAI Agent Security

  10. Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection

    Aug 28, 2025Harethah Abu Shairah, Hasan Abed Al Kader Hammoud, George Turkiyyah +1LLM GuardrailsLLM Safety Alignment