Security Evaluation

Momentum

13 papers in the last four weeks, up 160% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 99

All topics
CardsList
  1. AgentSpy: Making AI Agent Behavior Observable

    Oct 5, 2026Christoph Bühler, Matteo Biagiola, Luca Di Grazia +1Security Evaluation

  2. Measurement-First Auditing of Agentic Leaderboards: Contamination Susceptibility, Matched-Control Re-evaluation, and Scorer Validation

    Oct 5, 2026Dishu Yang, Qi Su, Hongbo Qin +1LeaderboardModel Auditing

  3. SCOUT: Synergizing Reasoning and Tool-Use for Computer-Use Safety

    Sep 28, 2026Jianxing Chen, Xiao Yu, Shipra Agrawal +1Safety BenchmarksSecurity Evaluation

  4. MMSkillRisk: Can Agents Stay Safe When Multimodal Skills Become Traps?

    Sep 28, 2026Lingqi Jiang, Jialuo Chen, Jianan Ma +8Multimodal AgentsSecurity Evaluation

  5. Coding Agents Aren't Enough! Evaluating an Enterprise Security Brain for Agentic Cloud Investigations

    Sep 24, 2026Leon Goldberg, Gal Engelberg, Eden Yavin +3Security EvaluationSecurity

  6. On the Effectiveness of Kernel-Level Evidence for Agent Security

    Sep 24, 2026Spencer King, Zhilu Zhang, Mikhail Kuznetsov +3Security EvaluationSecurity

  7. MiST: Mid-Training LLMs for Cybersecurity

    Sep 16, 2026Oded Ovadia, Elad Ben Zaken, Elad Guttman +1CybersecurityLarge Language Model Training

  8. Vulnerability Localization Benchmark: Measuring Agentic Security Analysis at Repository Scale

    Sep 14, 2026Aman Priyanshu, Supriti Vijay, Kimia Majd +8Model VulnerabilitiesVulnerable Code

  9. BenchShield: Formal Model-Backed Instrumentation for Reward Integrity in LLM-Agent Evaluation Infrastructure

    Sep 12, 2026Shenghan Zheng, Zonglin Di, Yimin Liu +19Adversarial EvaluationSecurity Evaluation

  10. X-amine509: Predicting the Practical Risk Level of Enterprise X.509 Certificates

    Sep 8, 2026Cameron Keith, Shubh Patel, JD Kilgallin +1CertificatesSecurity Evaluation

  11. Do AI Coding Assistants Check Before They Install? A Pre-Registered Demand-Side Audit of Trust Signals in the Research Software Supply Chain

    Sep 7, 2026Pengyin ShanAi-Assisted Programming TasksModel Auditing

  12. Labels Are Not Endpoints: Treatment Leakage and Construct Validity in MCP Agent Security Evaluation

    Aug 13, 2026Rana Muhammad Ahmed, Sabahat AbbasSecurity EvaluationModel Auditing

  13. ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

    Aug 12, 2026Yutao Mou, Pengfei Yang, Zhe Yin +6Attacker Large Language ModelIndirect Prompt Injection

  14. The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

    Aug 11, 2026Jeremy Spence, Nicholas Assaderaghi, Feng Xiao +9Security EvaluationReverse Engineering

  15. ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents

    Aug 10, 2026Hongwei Yao, Yiming Liu, Meihui Chen +6Security EvaluationAgentic Benchmarks

  16. IntelliAudit: Using Large Language Models to Evaluate Audit Controls

    Aug 7, 2026Allison Wilson, Sina Moradi Sabet, Diar Shakimov +4Model AuditingSecurity Evaluation

  17. Enhancing Anomaly Resilience in Research Networks: A Large-Scale Forecasting Benchmark for Dynamic Security Baselining

    Aug 6, 2026Mohammad Arafath Uddin Shariff, Byrav RamamurthyAccurate Traffic ForecastingCybersecurity

  18. Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation

    Aug 2, 2026Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego KreutzLarge Language Model SafetyCode Generation

  19. MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair

    Jul 29, 2026Xuanze Chen, Xukang Xie, Wentao Fu +3PoisoningSecurity Evaluation

  20. SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response

    Jul 29, 2026Lehan Wang, Boli Chen, Ruixue Ding +7Incident ResponseSecurity Evaluation

  21. EXE-Bench: Ranking the Tradeoffs of AI-based Windows Malware Detectors for Real-World Usability

    Jul 27, 2026Andrea Ponte, Daniel Gibert, Matous Kozak +5MalwareSecurity Evaluation

  22. ADVERSARIAL: And-Inverter Graph-Assisted Hardware Trojan Detection At Scale

    Jul 26, 2026Yaroslav Popryho, Debjit Pal, Inna Partin-VaisbandMalwareCircuits

  23. Every Model Cheats: Prompt-Level Mitigation of Cheating on Offensive Cyber Tasks

    Jul 23, 2026Michael Kouremetis, Ads Dawson, Raja Sekhar Rao Dheekonda +1Security Evaluation

  24. Evaluating Large Language Models for Symbolic Security Protocol Analysis

    Jul 22, 2026Paolo Modesti, Syed Ahmed, Ioannis Sfyrakis +1Large Language Model SafetySecurity Evaluation

  25. Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

    Jul 22, 2026Or Zion Eliav, Eyal Lenga, Shir Bernstien +1Penetration TestingArtificial Intelligence Agents

  26. Broken Gates: Re-evaluating Web Bot Defenses in the Age of LLM Agents

    Jul 21, 2026Behzad Ousat, Nikita Turkmen, Lalchandra Rampersaud +2CaptchaBrowser Agent

  27. Revisiting data-driven dynamic security assessment with a tabular foundation model

    Jul 17, 2026Olayiwola Arowolo, Maosheng Yang, Jochen CremerPower SystemsTabular Foundation Models

  28. Reliable Remediation Impact Prediction for Black-Box Security Ratings

    Jul 17, 2026Nada Hanad, Mehdi Acheli, Ali NourEldin +2RemediationSecurity Evaluation

  29. Democratizing Agent Deployment Safety: A Structural Monitoring Approach

    Jul 16, 2026Preeti Ravindra, Rahul Tiwari, Vincent WolowskiAgentic DeploymentsSecurity Evaluation

  30. SMETA-ZSL:Semantic Meta-Alignment for Zero-Shot Threat Classification

    Jul 10, 2026Ivan Alejandro Montoya Sanchez, Anantaa Kotal, Aritran PiplaiCybersecurityThreat

  31. Secret Scanner Agent: Extracting Secrets and Access Context from Unstructured Documents

    Jul 10, 2026Zixiao Chen, Mariko Wakabayashi, Charlotte SiskaSecurity EvaluationData Leakage

  32. Reverse Engineering Compliance: A Dual-Graph Verification Framework for Auditing Legacy IT Security Concepts

    Jul 9, 2026Lea Roxanne Muth, Marian MargrafSecurity EvaluationReverse Engineering

  33. i-EXAM: Instructable and Explainable Attack Connectivity Graph Modeler

    Jul 7, 2026Rakesh Podder, Wadia Ganim, Sarath Sreedharan +2Security EvaluationDiverse Hardening Strategies

  34. Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions

    Jul 3, 2026Eduardo Almeida Palmieri, Mohamed Chahine Ghanem, Dipo Dunsin +3Security EvaluationGenerative Artificial Intelligence

  35. Red-Teaming the Agentic Red-Team

    Jun 23, 2026Dario Pasquini, Michal Bazyli, Taras Fedynyshyn +1Security EvaluationAgentic

  36. SafeClawBench: Separating Semantic, Audit-Evidence, and Sandbox Harm in Tool-Using LLM Agents

    Jun 16, 2026Yuchuan Tian, Mengyu Zheng, Haocheng Mei +5Large Language Model SafetySecurity Evaluation

  37. Execution-bound advisory automation for agentic AI: a reproducible AIBOM-driven CSAF-VEX framework

    Jun 16, 2026Petar Radanliev, Omar Santos, Carsten Maple +1Security EvaluationRuntime Enforcement

  38. SPARK: Security Knowledge Priming and Representation-Guided Knowledge Activation for LLM-based Secure Code Generation

    Jun 15, 2026Xiaoyun Xu, Lichao Wu, Jona te Lintelo +2Large Language Model SafetyVulnerable Code

  39. SkillVetBench: LLM-as-Judge for Multi-Dimensional Security Risk Evaluation in Open-Source LLM Agent Skills

    Jun 14, 2026Ismail Hossain, Sai Puppala, Md Jahangir Alam +2Security EvaluationLarge Language Model Safety

  40. OSGuard: A Benchmark for Safety in Computer-Use Agents

    Jun 13, 2026Mina Mohammadmirzaei, Jeffrey FlaniganSafety BenchmarksComputer-Use Agents

  41. A Security Analysis of Long-Horizon Agentic AI Systems: Threats, Evaluation, and Framework Development

    Jun 12, 2026Ahmed Mohammed Almalki, Mehedi MasudSecurity EvaluationProduction Agentic Systems

  42. Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents

    Jun 11, 2026Zihao Wang, Yiming Li, Yutong Wu +8Prompt-Injection DetectorsIndirect Prompt Injection

  43. Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirical Assessment

    Jun 10, 2026Derek Yohn, Luke Flancher, Mirajul Islam +1Security EvaluationCybersecurity

  44. Privacy-Preserving Federated Autoencoder for ECG Anomaly Detection on Edge Devices

    Jun 10, 2026Kaan Arda Akyol, Jakub Kacper Szeląg, Aydin Abadi +9Electrocardiogram ClassificationEdge Devices

  45. Benchmarking and Exploring the Capabilities of LLMs for Attack Investigations

    Jun 9, 2026Aniket Anand, Yiwei Hou, Daniel Fields +4Security EvaluationAttacker Large Language Model

  46. CyberGym-E2E: Scalable Real-World Benchmark for AI Agents' End-to-End Cybersecurity Capabilities

    Jun 3, 2026Tianneng Shi, Robin Rheem, Dongwei Jiang +13CybersecuritySecurity Evaluation