LLMs for Cybersecurity

LLM: Large Language Model

Momentum

19 papers in the last four weeks, up 280% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 166

All topics
CardsList
  1. Constrained-Action AI Remediation for SIEM/XDR via a NeMo-Guardrails Proxy

    Oct 7, 2026Georgios Koutidis, Nikolaos Kekatos, Tom Nianios +1LLMs for CybersecurityTool Access Control for LLM Agents

  2. MARS: Malware Analysis with Rule-Based Scoring of LLM Claims

    Oct 7, 2026Hyeongjun ChoiMalware ClassificationLLMs for Cybersecurity

  3. Sigma-Hunter: A Domain-Specific Language Model for Threat Hunting and Detection Engineering

    Oct 6, 2026Kemal Davaslioglu, Sastry KompellaLLMs for Cybersecurity

  4. Does AI Help Cyber Attackers or Defenders? Evidence from Nonpublic Vulnerabilities and Subsequent Attacks

    Oct 5, 2026Tobias Heldt, Matt Turk, Christoph Landolt +1Automated Program RepairCybersecurity

  5. Correct Verdicts, Flawed Reasoning: Structured Auditing of LLM-based Vulnerability Reasoning

    Oct 5, 2026Boyue Caroline Hu, Kaivalya Ahir, Ronghao Ni +1LLM AuditingSoftware Vulnerability Detection

  6. AutoDP-LLM: Automating Data Pre-processing for Intrusion Detection Systems using Large Language Models

    Oct 4, 2026Bao-Phong Nguyen, Gia-Khanh Pham, Thai-Duong Do +7Network Intrusion DetectionLLMs for Cybersecurity

  7. KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

    Oct 1, 2026Pengfei Li, Naufal Suryanto, Sicheng Zhang +1LLMs for CybersecurityLLM Tool Use

  8. HydroJEV: A one-second, training-free screen for cyber-attack and fault attribution in water distribution networks

    Oct 1, 2026Tianwei Mu, Shengyan Jiang, Mingzhe Yuan +5CybersecurityLLMs for Cybersecurity

  9. Jev-IDS: System One Models for Network Intrusion Detection

    Oct 1, 2026Paulo Severo, Silvio E. Quincozes, Amanda DiasNetwork Intrusion DetectionLLMs for Cybersecurity

  10. Towards Hierarchical Cyber Defense with Large Language Models: From Planning to Execution

    Sep 30, 2026Harshith Doppalapudi, Nathaniel D. Bastian, Ankit ShahAutonomous Cyber DefenseLanguage Model-Based Control

  11. No One Architecture Fits All: A Cross-Environment Evaluation of Hierarchical Red Team Agents

    Sep 30, 2026Ayan Javeed Shaikh, Arunesh Sinha, Nathaniel D. Bastian +1LLM Red TeamingAI Agent Evaluation

  12. HESP: Separating What to Probe from When to Stop in Local LLM Alert-Triage Agents

    Sep 27, 2026Zhuowen Liu, Zhixuan WangLLMs for CybersecurityLLM Agent Reliability

  13. Where Cyber Agents Struggle: Bottleneck Analysis of Multi-Stage LLM Agents

    Sep 23, 2026Saeedeh Lohrasbi, Mohammad Mamun, Ahmed Yehia +2Agent Failure AnalysisLLM Agent Evaluation

  14. Metrics Failure in LLM-Based Code Vulnerability Repair: An Empirical Study and a Change-Aware Screen

    Sep 22, 2026Om Nepal, Sushant Aryal, Oluseyi Olukola +1Automated Program RepairLLMs for Cybersecurity

  15. ALIBI: Adversarial Legitimacy Injection in Binary Input against LLM Malware Analyzers

    Sep 17, 2026Hyeongjun Choi, Wonyoung Jung, Haehoon Seo +1Adversarial Attacks on LLMsLLM Security

  16. MiST: Mid-Training LLMs for Cybersecurity

    Sep 16, 2026Oded Ovadia, Elad Ben Zaken, Elad Guttman +1Synthetic Data PretrainingDomain-Adaptive Pretraining

  17. PentestChain: A Cost-Aware, MCP-Orchestrated Framework for Automated Penetration Testing with Free-Tier LLMs

    Sep 16, 2026Rushabh Vipulkumar Patel, Dipo Dunsin, Mohammed Almaiah +1Automated Penetration TestingLLMs for Cybersecurity

  18. Vulnerability Localization Benchmark: Measuring Agentic Security Analysis at Repository Scale

    Sep 14, 2026Aman Priyanshu, Supriti Vijay, Kimia Majd +8Software Vulnerability DetectionAI Agent Security

  19. Architecting the Secure AI-SOC: A Neurosymbolic Framework for Pipeline Integrity and Threat Mitigation

    Sep 12, 2026Anna Gazani, Spyridon Kounoupidis, Panagiotis Katsaros +3CybersecurityIndirect Prompt Injection

  20. Evaluating Context Segmentation in Locally Deployable SLMs for Cybersecurity CTF Tasks

    Sep 11, 2026Sebastiano Nordio, Michele LottoCybersecuritySmall Language Models

  21. Evidence-Grounded Retrieval for Investigation Hunt Lead Generation from CTI Reports

    Sep 8, 2026Akash Prakash, Boubakr Nour, Makan Pourzandi +2Retrieval-Augmented GenerationCyber Threat Intelligence

  22. Benchmark Scores Are Pipeline-Dependent: A Reliability Audit of Cybersecurity LLM Benchmarks

    Sep 8, 2026Aymene Berriche, Cathrine Shalby, Mohannad Alhanahnah +1LLM EvaluationLLM Auditing

  23. CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild

    Aug 24, 2026Jian Yang, Haau-Sing Li, Shawn Guo +10CybersecuritySoftware Security

  24. LLM-Assisted Dynamic Threat Analysis for Attacker-Reachable Software Weaknesses in Autonomous Vehicles

    Aug 13, 2026Md Wasiul Haque, Sagar Dasgupta, Mizanur Rahman +1Automated Software TestingSoftware Vulnerability Detection

  25. The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

    Aug 11, 2026Jeremy Spence, Nicholas Assaderaghi, Feng Xiao +9Software Reverse EngineeringAI Agent Security Benchmarks

  26. RangeFactory: Scalable Construction of Multi-Hop Cyber Ranges

    Aug 10, 2026Hanlin Jiang, Puyi Wang, Jiandong Jin +10CybersecurityAutomated Penetration Testing

  27. Retrieval-Constrained Policy Optimization for Attack Technique Extraction from Cyber Threat Intelligence

    Aug 7, 2026Jiayun Zhang, Junshen Xu, Zejun Xie +1Cyber Threat IntelligenceCybersecurity