AI Agent Safety

Momentum

22 papers in the last four weeks, up 144% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 207

All topics
CardsList
  1. Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models

    Jun 16, 2026Jasmine Brazilek, Joel Christoph, Maheep Chaudhary +4AI Agent EvaluationAI Agent Safety

  2. When Agent Automation Becomes Profitable: Quantifying and Insuring Autonomous AI Risk through Trace-Economic Underwriting

    Jun 15, 2026Binyan Xu, Xilin Dai, Fan Yang +1AI Risk ManagementAI Agent Safety

  3. An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios

    Jun 15, 2026Hankyul Baek, Jaewon Noh, Sang Seo +5Data LeakageLLM Agent Evaluation

  4. The Perils of Agency: How Developers Perceive, Prioritize, and Address Risks in Agentic AI Products

    Jun 13, 2026Hao-Ping Lee, Jessica He, David Piorkowski +3AI Risk ManagementAI Agent Safety

  5. Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment

    Jun 13, 2026Lipeng He, Yihan Wang, Jiawen Zhang +1Adversarial TrainingAI Agent Safety

  6. ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures

    Jun 13, 2026Kenneth Ge, Andre AssisAgent Failure AnalysisAI Coding Agents

  7. OSGuard: A Benchmark for Safety in Computer-Use Agents

    Jun 13, 2026Mina Mohammadmirzaei, Jeffrey FlaniganComputer-Use AgentsLLM Guardrails

  8. Selective Agentic Recovery for UAV Autonomy with a Persistent Mission Runtime

    Jun 12, 2026Taewoo Park, Kyeonghyun Yoo, Seunghyun Yoo +1UAV NavigationRobot Failure Recovery

  9. Hidden in Plain Sight: Benchmarking Agent Safety Against Decomposition Attacks with DECOMPBENCH

    Jun 12, 2026Vikhyath Kothamasu, Virginia Smith, Chhavi YadavAI Agent SafetyAI Agent Safety Benchmarks

  10. A Virtuous AI is an Existential Risk

    Jun 11, 2026Guillermo Del Pinal, Youngchan Lee, Min OhnLLM Safety AlignmentAI Agent Safety

  11. The Containment Gap: How Deployed Agentic AI Frameworks Fail Public-Facing Safety Requirements

    Jun 11, 2026Md Jafrin Hossain, Mohammad Arif Hossain, Weiqi Liu +1AI Agent SecurityAI Agent Safety

  12. The Impossibility of Eliciting Latent Knowledge

    Jun 10, 2026Korbinian Friedl, Francis Rhys Ward, Paul Yushin Rapoport +2AI Agent SafetyLLM Honesty

  13. Towards Responsibly Non-Compliant Machines

    Jun 10, 2026Marija Slavkovik, Marie Farrell, Louise Dennis +3AI AccountabilityAI Agent Safety

  14. SafeGEO: Understanding Generative Engine Optimization Risks in Recommendation Agents

    Jun 8, 2026Qianfeng Wen, Yifan Simon Liu, Xin Liu +4Generative Engine OptimizationLLM Agent Security

  15. Beyond Goodhart's Law: A Dynamic Benchmark for Evaluating Compliance in Multi-Agent Systems

    Jun 5, 2026Yiyang Zhao, Zhuo Zhang, Qingxuan Le +2Multi-Agent LLM SystemsAI Agent Safety

  16. From Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monitoring in LLM Agents

    Jun 4, 2026Patrick Wilhelm, Odej KaoReward HackingAI Agent Safety

  17. PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

    Jun 3, 2026Hainiu Xu, Italo Luis da Silva, Jiangnan Ye +7LLM Safety BenchmarksMoral Reasoning in Language Models

  18. Attack Selection in Agentic AI Control Evaluations Meaningfully Decreases Safety

    Jun 3, 2026Catherine Ge-Wang, Tyler Crosse, Benjamin Hadad +3Adversarial AttacksAI Agent Safety

  19. PerceptTwin: Semantic Scene Reconstruction for Iterative LLM Planning and Verification

    Jun 2, 2026Charlie Gauthier, Sacha Morin, Liam PaullLarge Language Model-Based Robot PlanningRobotics Simulation

  20. Agentic Safety is an Epistemic Property, Not a Behavioral One

    Jun 2, 2026Charles L. Wang, Keir Dorchen, Peter JinAI AlignmentAI Agent Safety

  21. VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring

    Jun 2, 2026Hanjiang Hu, Yiyuan Pan, Jiaxing Li +5Egocentric Video UnderstandingAI Agent Safety

  22. RUBAS: Rubric-Based Reinforcement Learning for Agent Safety

    Jun 2, 2026Xian Qi Loye, Qinglin Su, Zhexin Zhang +5Reinforcement LearningAI Agent Safety

  23. Solipsistic Superintelligence is Unlikely to be Cooperative

    Jun 2, 2026Rakshit S Trivedi, Natasha Jaques, Logan Cross +2AI AlignmentMulti-Agent Collaboration

  24. Glass Box at Orbit: A Constitutional AI Verification Framework for Trustworthy Autonomous CubeSat Intelligence

    Jun 2, 2026Karthik Barma, Anil Sanneboyina, V C Premchand YadavAI AlignmentAI Agent Safety