Guardrail

Momentum

7 papers in the last four weeks, level with the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 50

All topics
CardsList
  1. ReF-HIL: Shaping the Critic around Human Action Neighborhoods for Efficient Human-in-the-Loop Reinforcement Learning

    Sep 29, 2026Shaoyin Luo, Song Wang, Shibo Xia +5Reinforcement Learning From Human FeedbackHuman-In-The-Loop

  2. Learning Beyond What Humans Can Demonstrate

    Sep 21, 2026Yuchen Song, Aditya Mittal, Unnat JainTeleoperationBehavior Cloning

  3. Safety Beyond the Interface: Detecting Harm via Latent States in Large Language Models

    Sep 16, 2026Alizishaan Khatri, Chiquita Prabhu, Omkar NeogiLarge Language Model SafetyGuardrail

  4. Overflip: Repetition-Induced Label Flips in Guardrail Models

    Sep 14, 2026Xu He, Chih-Hsuan Lin, Hung-Mao Chen +3FlipsGuardrail

  5. Guardrailed Meta-Agent Loops: Stress-Testing Policy Pinning, Budget Bounds, and Crash Recovery

    Sep 14, 2026Qinzhen Ma, Jialin WuAgent LoopGuardrail

  6. Suan: Rectifying Direct Preference Safety Alignment in Large Language Models

    Sep 8, 2026Oleksandr Cherednichenko, Roman KlypaSafety AlignmentLarge Language Model Alignment

  7. Influence Is Not Authority: When Causal Guardrail Signals Make Legitimate Tool Use Look Like an Attack in Tool-Using LLM Agents

    Aug 30, 2026Tanzim Ahad, Ismail Hossain, Md Jahangir Alam +3Controlling Tool UseGuardrail

  8. LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails

    Aug 27, 2026Ziyang Chen, Xing Wu, Songlin HuGuardrailLarge Language Model Safety

  9. Reflex-Guard: A Low-Latency Guardrail for LLM Prompt Safety Using Dense Semantic Embeddings

    Aug 18, 2026Istiaque Ahmed, Afia Anjum Borsha, Ranat Das Prangon +2Large Language Model SafetyGuardrail

  10. ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

    Aug 11, 2026Xinzhe Huang, Biwu Yao, Kedong Xiu +4Large Language Model SafetyGuardrail

  11. Yesterday's Shield, Today's Spear: A Self-Evolving Safety Guardrail in Production

    Aug 9, 2026Cong Ming, Jingyi Chen, Bin Liu +4GuardrailLarge Language Model Safety

  12. ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

    Aug 6, 2026Abdulkadir Külçe, Alihan Esen, Çağla Fikir +4HealthcareGuardrail

  13. GuardianAgentBench: Where Agents Fail and How to Guard Them

    Jul 23, 2026Vishal Ishwar Naik, Chenyu Xu, Donna Dong +5Agentic BenchmarksLarge Language Model Safety

  14. A Dual-Hypothesis Reasoning Framework for LLM Guardrails

    Jul 20, 2026Md Asiful Islam, Mihai SurdeanuLarge Language Model SafetyGuardrail

  15. PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails

    Jul 7, 2026Mingyang Song, Luxin Xu, Haoyu Sun +3Streaming GuardrailsGuardrail

  16. Integrated Graph Search and Model Predictive Control for Smooth and Efficient Path Planning in Autonomous Vehicles

    Jul 5, 2026Duc-Tien Bui, Ngoc Thinh Nguyen, Hung Duy Nguyen +3Path PlanningVehicle Dynamics

  17. Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

    Jul 2, 2026William Hackett, Peter GarraghanGuardrailLarge Language Model Safety

  18. Neuro-Symbolic Agents for Regulated Process Automation: Challenges and Research Agenda

    Jun 11, 2026Alexander Rombach, Chantale Lauer, Nijat MehdiyevNeuro-Symbolic FrameworkAutomated

  19. Epistemic Injustice in Language Models: An Audit of Pretraining Filters and Guardrails

    Jun 4, 2026Marco Antonio Stranisci, A Pranav, Rossana Damiano +2Large Language Model BiasGuardrail

  20. From Risk Classification to Action Plan Remediation: A Guardrail Feedback Driven Framework for LLM Agents

    Jun 4, 2026Yuhao Sun, Jiacheng Zhang, Shaanan Cohney +3GuardrailLarge Language Model Safety

  21. Long-Term and Short-Term Transistor Aging in Deep Neural Networks: Impact and Mitigation

    Jun 2, 2026Alireza Sarmadi, Virinchi Roy Surabhi, Prashanth Krishnamurthy +3Neural Network InferencePrinted Circuit Board

  22. EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents

    May 29, 2026Dongwook Choi, Taeyoon Kwon, Bogyung Jeong +6Embodied AgentsHazard

  23. Triaging Threats to Specialized Guardrails

    May 29, 2026Wenjie Jacky Mo, Xiaofei Wen, Rui Cai +6GuardrailLarge Language Model Safety

  24. Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content

    May 28, 2026Ihor Stepanov, Aleksandr SmechovLarge Language Model SafetyGuardrail

  25. Robust and Efficient Guardrails with Latent Reasoning

    May 27, 2026Siddharth Sai, Xiaofei Wen, Muhao ChenLarge Language Model SafetyGuardrail

  26. Test-Time Training Undermines Safety Guardrails

    May 21, 2026Simone Antonelli, Sadegh Akhondzadeh, Aleksandar BojchevskiInference-Time DefenseTest-Time Training

  27. CR4T: Rewrite-Based Guardrails for Adolescent LLM Safety

    May 20, 2026Heajun An, Qi Zhang, Vedanth Achanta +1Large Language Model SafetyGuardrail

  28. Robotics-Inspired Guardrails for Foundation Models in Socially Sensitive Domains

    May 19, 2026Rebecca Ramnauth, Drazen Brscic, Brian ScassellatiGuardrailComplex Societies

  29. Why Do Safety Guardrails Degrade Across Languages?

    May 16, 2026Max Zhang, Ameen Patel, Sang T. Truong +1Multilingual SafetyLarge Language Model Safety

  30. LiSA: Lifelong Safety Adaptation via Conservative Policy Induction

    May 14, 2026Minbeom Kim, Lesly Miculicich, Bhavana Dalvi Mishra +6Artificial Intelligence SafetyGuardrail

  31. LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs

    May 13, 2026Rodrigo Nogueira, Thales Sales Almeida, Giovana Kerche Bonás +7Argumentation FrameworksElicitation

  32. Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs

    May 11, 2026Krishak Aneja, Manas Mittal, Anmol Goel +2Emergent MisalignmentLarge Language Model Alignment

  33. GLiGuard: Schema-Conditioned Classification for LLM Safeguard

    May 8, 2026Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney +1Large Language Model SafetyStreaming Guardrails

  34. BabelSafe: A Policy-Grounded Multilingual Safety Benchmark for LLMs

    May 1, 2026Yunhan Zhao, Zhaorun Chen, Xingjun Ma +1Multilingual SafetyLarge Language Model Safety

  35. Guardrails in Logit Space: Safety Token Regularization for LLM Alignment

    Apr 19, 2026Thong Bach, Truyen TranSafety AlignmentLarge Language Model Alignment

  36. Proof-of-Guardrail in AI Agents and What (Not) to Trust from It

    Mar 6, 2026Xisen Jin, Michael Duan, Qin Lin +4On-Chain AttestationsGuardrail

  37. NeuroFilter: Activation-Based Guardrails for Privacy-Conscious LLM Agents

    Jan 21, 2026Saswat Das, Ferdinando FiorettoPrivacyGuardrail