LLM Agent Safety

LLM: Large Language Model

Momentum

24 papers in the last four weeks, up 50% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 193

All topics
CardsList
  1. DBA-Bench: A Production-Fidelity Benchmark for LLM-Based Database Operations Agents

    Jul 24, 2026Junming Chen, Junyang Jiang, Xu Chen +2Benchmark DesignAI Agent Benchmarks

  2. Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation

    Jul 23, 2026Linjun LiMulti-Agent LLM SystemsLLM Safety

  3. JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety

    Jul 22, 2026Yuan Xiong, Linji Hao, Shizhu He +2AI Agent SafetyLLM Agent Safety

  4. Agents in the Wild: Where Research Meets Deployment

    Jul 21, 2026Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz +3AI Agent ReliabilityMulti-Agent LLM Systems

  5. ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems

    Jul 20, 2026Elias Hossain, Md Mehedi Hasan Nipu, Fatema Tuj Johora Faria +2LLM Agent SecurityPrompt Injection Attacks on AI Agents

  6. Operational Hallucination and Safety Drift in AI Agents

    Jul 20, 2026Shasha Yu, Fiona Carroll, Barry L. BentleyLLM Agent EvaluationAI Agent Safety

  7. ToolAlignBench: Investigating Alignment Conflicts in Tool-Calling Enabled LLMs

    Jul 15, 2026Aryan Keluskar, Amrita Bhattacharjee, Huan LiuLLM AlignmentAI Agent Safety Benchmarks

  8. SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing

    Jul 15, 2026Tianyu Chen, Chujia Hu, Wenjie WangLanguage Model Safety EvaluationLLM Guardrails

  9. LOGOS: A Living Logic for AI Agent Teams That Evolve With Humans

    Jul 12, 2026Yuma Ichikawa, Yamato Arai, Kosaku Kimura +2Multi-Agent LLM SystemsHuman-in-the-Loop AI

  10. The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents

    Jul 8, 2026Xing Zhang, Yanwei Cui, Guanghui Wang +4LLM-as-a-JudgeLLM Agent Safety

  11. Operational Reframing and Approval-Framed Delegation in Multi-Agent LLM Safety

    Jul 8, 2026Lifei Liu, Haoran Yu, Xiaochong Jiang +3Multi-Agent LLM SystemsLLM Safety Evaluation

  12. Toward Trustworthy Large Language Model Agents in Healthcare

    Jul 6, 2026Hadi Hasan, Safaa Salman, Adam Tai Abou Dargham +2HealthcareLLM Agent Safety

  13. Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses

    Jul 6, 2026Neeraj Karamchandani, Piyush Nagasubramaniam, Sencun Zhu +1LLM Agent MemoryAgent Memory Poisoning

  14. Agentic-V2X: Small Language Model Agents for Deadline-Aware V2X Scheduling in 5G/6G Networks

    Jul 5, 2026Gerasimos Papanikolaou-Ntais, Alexandros Kaloxylos, Athanasios KanavosLanguage Model-Based ControlSmall Language Models

  15. DualView: Preventing Indirect Prompt Injection in Personal AI Agents

    Jul 4, 2026Juhee Kim, Woohyuk Choi, Taehyun Kang +2LLM Agent SecurityIndirect Prompt Injection

  16. SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces

    Jul 2, 2026Jinwei Hu, Yi Dong, Youcheng Sun +1LLM AgentsAgent Skill Security Auditing

  17. Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

    Jul 2, 2026Yunhao Feng, Ruixiao Lin, Ming Wen +12AI Agent SafetyAI Agent Safety Benchmarks