LLMs for Cybersecurity

LLM: Large Language Model

Momentum

19 papers in the last four weeks, up 280% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 163

All topics
CardsList
  1. Constrained-Action AI Remediation for SIEM/XDR via a NeMo-Guardrails Proxy

    Oct 7, 2026Georgios Koutidis, Nikolaos Kekatos, Tom Nianios +1LLMs for CybersecurityTool Access Control for LLM Agents

  2. MARS: Malware Analysis with Rule-Based Scoring of LLM Claims

    Oct 7, 2026Hyeongjun ChoiMalware ClassificationLLMs for Cybersecurity

  3. Sigma-Hunter: A Domain-Specific Language Model for Threat Hunting and Detection Engineering

    Oct 6, 2026Kemal Davaslioglu, Sastry KompellaLLMs for Cybersecurity

  4. Does AI Help Cyber Attackers or Defenders? Evidence from Nonpublic Vulnerabilities and Subsequent Attacks

    Oct 5, 2026Tobias Heldt, Matt Turk, Christoph Landolt +1Automated Program RepairCybersecurity

  5. Correct Verdicts, Flawed Reasoning: Structured Auditing of LLM-based Vulnerability Reasoning

    Oct 5, 2026Boyue Caroline Hu, Kaivalya Ahir, Ronghao Ni +1LLM AuditingSoftware Vulnerability Detection

  6. AutoDP-LLM: Automating Data Pre-processing for Intrusion Detection Systems using Large Language Models

    Oct 4, 2026Bao-Phong Nguyen, Gia-Khanh Pham, Thai-Duong Do +7Network Intrusion DetectionLLMs for Cybersecurity

  7. KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

    Oct 1, 2026Pengfei Li, Naufal Suryanto, Sicheng Zhang +1LLMs for CybersecurityLLM Tool Use

  8. HydroJEV: A one-second, training-free screen for cyber-attack and fault attribution in water distribution networks

    Oct 1, 2026Tianwei Mu, Shengyan Jiang, Mingzhe Yuan +5CybersecurityLLMs for Cybersecurity

  9. Jev-IDS: System One Models for Network Intrusion Detection

    Oct 1, 2026Paulo Severo, Silvio E. Quincozes, Amanda DiasNetwork Intrusion DetectionLLMs for Cybersecurity

  10. Towards Hierarchical Cyber Defense with Large Language Models: From Planning to Execution

    Sep 30, 2026Harshith Doppalapudi, Nathaniel D. Bastian, Ankit ShahAutonomous Cyber DefenseLanguage Model-Based Control

  11. No One Architecture Fits All: A Cross-Environment Evaluation of Hierarchical Red Team Agents

    Sep 30, 2026Ayan Javeed Shaikh, Arunesh Sinha, Nathaniel D. Bastian +1LLM Red TeamingAI Agent Evaluation

  12. HESP: Separating What to Probe from When to Stop in Local LLM Alert-Triage Agents

    Sep 27, 2026Zhuowen Liu, Zhixuan WangLLMs for CybersecurityLLM Agent Reliability

  13. Where Cyber Agents Struggle: Bottleneck Analysis of Multi-Stage LLM Agents

    Sep 23, 2026Saeedeh Lohrasbi, Mohammad Mamun, Ahmed Yehia +2Agent Failure AnalysisLLM Agent Evaluation

  14. Metrics Failure in LLM-Based Code Vulnerability Repair: An Empirical Study and a Change-Aware Screen

    Sep 22, 2026Om Nepal, Sushant Aryal, Oluseyi Olukola +1Automated Program RepairLLMs for Cybersecurity

  15. ALIBI: Adversarial Legitimacy Injection in Binary Input against LLM Malware Analyzers

    Sep 17, 2026Hyeongjun Choi, Wonyoung Jung, Haehoon Seo +1Adversarial Attacks on LLMsLLM Security

  16. MiST: Mid-Training LLMs for Cybersecurity

    Sep 16, 2026Oded Ovadia, Elad Ben Zaken, Elad Guttman +1Synthetic Data PretrainingDomain-Adaptive Pretraining

  17. PentestChain: A Cost-Aware, MCP-Orchestrated Framework for Automated Penetration Testing with Free-Tier LLMs

    Sep 16, 2026Rushabh Vipulkumar Patel, Dipo Dunsin, Mohammed Almaiah +1Automated Penetration TestingLLMs for Cybersecurity

  18. Vulnerability Localization Benchmark: Measuring Agentic Security Analysis at Repository Scale

    Sep 14, 2026Aman Priyanshu, Supriti Vijay, Kimia Majd +8Software Vulnerability DetectionAI Agent Security

  19. Architecting the Secure AI-SOC: A Neurosymbolic Framework for Pipeline Integrity and Threat Mitigation

    Sep 12, 2026Anna Gazani, Spyridon Kounoupidis, Panagiotis Katsaros +3CybersecurityIndirect Prompt Injection

  20. Evaluating Context Segmentation in Locally Deployable SLMs for Cybersecurity CTF Tasks

    Sep 11, 2026Sebastiano Nordio, Michele LottoCybersecuritySmall Language Models

  21. Evidence-Grounded Retrieval for Investigation Hunt Lead Generation from CTI Reports

    Sep 8, 2026Akash Prakash, Boubakr Nour, Makan Pourzandi +2Retrieval-Augmented GenerationCyber Threat Intelligence

  22. Benchmark Scores Are Pipeline-Dependent: A Reliability Audit of Cybersecurity LLM Benchmarks

    Sep 8, 2026Aymene Berriche, Cathrine Shalby, Mohannad Alhanahnah +1LLM EvaluationLLM Auditing

  23. CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild

    Aug 24, 2026Jian Yang, Haau-Sing Li, Shawn Guo +10CybersecuritySoftware Security

  24. LLM-Assisted Dynamic Threat Analysis for Attacker-Reachable Software Weaknesses in Autonomous Vehicles

    Aug 13, 2026Md Wasiul Haque, Sagar Dasgupta, Mizanur Rahman +1Automated Software TestingSoftware Vulnerability Detection

  25. The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

    Aug 11, 2026Jeremy Spence, Nicholas Assaderaghi, Feng Xiao +9Software Reverse EngineeringAI Agent Security Benchmarks

  26. RangeFactory: Scalable Construction of Multi-Hop Cyber Ranges

    Aug 10, 2026Hanlin Jiang, Puyi Wang, Jiandong Jin +10CybersecurityAutomated Penetration Testing

  27. Retrieval-Constrained Policy Optimization for Attack Technique Extraction from Cyber Threat Intelligence

    Aug 7, 2026Jiayun Zhang, Junshen Xu, Zejun Xie +1Cyber Threat IntelligenceCybersecurity

  28. Post-Hoc Trajectory-Risk Certification for Modular LLM-Based Security Agents

    Aug 4, 2026Zhenpeng LiIoT Intrusion DetectionCybersecurity

  29. DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction

    Aug 4, 2026Xuyang Liu, Yibin Han, Zhenwei Zhang +8Retrieval-Augmented GenerationLLM Agent Evaluation

  30. Antares: Foundation Models for Agentic Vulnerability Localization

    Aug 3, 2026Supriti Vijay, Aman Priyanshu, Didier Chapoteau +8Software Vulnerability DetectionSmall Language Models

  31. EntailLLM: Verifying LLM-Generated Vulnerability Discovery Paths with Domain Knowledge via Logic Programming

    Aug 3, 2026Kaustuv Mukherji, Jaikrishna Manojkumar Patil, Colton Payne +4Logic ProgrammingSoftware Vulnerability Detection

  32. MITRE-SAGE: A Multi-Agent Cybersecurity Question-Answering Model

    Aug 3, 2026Ali Habibzadeh, Farid Feyzi, Reza Ebrahimi AtaniRetrieval-Augmented GenerationMulti-Agent LLM Systems

  33. From Chasing Ghosts to Missed Attacks: Perspectives and Perceptions of SOC Practitioners on LLM Integration, Risks, and Readiness

    Aug 1, 2026Jonas Thurner, Nadine Jost, Stefan Albert Horstmann +4CybersecurityLLMs for Cybersecurity

  34. Distilling Knowledge from Large Language Models into Lightweight Reinforcement Learning Agents for Autonomous Cyber Operations

    Jul 30, 2026Konur Tholl, François Rivest, Mariam El Mezouar +2Autonomous Cyber DefenseLLM-Guided RL

  35. ThreatForest: Multi-Agent Attack Tree Generation with Pluggable TTP Framework Mapping

    Jul 29, 2026Cristian Leo, Anton Dykyi, Danny Cortegaca +2LLMs for Cybersecurity

  36. HoF-Bench: Rediscovering Real AI-Discovered CVEs Without Frontier Models

    Jul 29, 2026Petr Simecek, Elnaz Babayeva, Jiri Balhar +23Software Vulnerability DetectionLLMs for Cybersecurity

  37. KQFuzz: Knowledge-Guided Fuzzing for Quantum Libraries via Large Language Models

    Jul 28, 2026Fuyuan Xia, Qixin Zhang, Chenhao Ying +5Automated Software TestingLLMs for Cybersecurity

  38. The Disruptive Impact of Large Language Models on Capture the Flag Competitions and the Path Toward Fair Play

    Jul 28, 2026Michael Macaulay, Harmony Bouabid, Guo Gen Ang +1CybersecurityLLMs for Cybersecurity

  39. DeepFaith: Evidence-Grounded LLMs for Faithful Incident Reporting in Multi-Stage APT Defense

    Jul 27, 2026Trung V. Phan, Tri Gia Nguyen, Thomas BauschertCybersecurityLLMs for Cybersecurity

  40. Every Model Cheats: Prompt-Level Mitigation of Cheating on Offensive Cyber Tasks

    Jul 23, 2026Michael Kouremetis, Ads Dawson, Raja Sekhar Rao Dheekonda +1LLM AuditingDeception in Language Models

  41. From Evaluation to Optimisation: Hierarchy-Aware Training Signals for CWE Prediction in Python

    Jul 23, 2026Muntasir Adnan, Manile Srun, Carlos C. N. KuhnSoftware Vulnerability DetectionLLMs for Cybersecurity

  42. Beyond Heavy Log Curation: Perplexity-Based APT Detection via Unsupervised, Context-Augmented Language Models

    Jul 23, 2026Shoya Otsu, Kei Suzuki, Toshiaki Koike-Akino +2Online Anomaly DetectionLLMs for Cybersecurity

  43. Evaluating Large Language Models for Symbolic Security Protocol Analysis

    Jul 22, 2026Paolo Modesti, Syed Ahmed, Ioannis Sfyrakis +1LLM EvaluationCybersecurity

  44. Find Before You Fine-Tune: A Diagnostic Study of Small LLMs for Cybersecurity QA

    Jul 21, 2026Shaswata Mitra, Subash Neupane, Trisha Chakraborty +4LLM EvaluationLLM Fine-Tuning

  45. Semi-Automated Detection of Gaps in LLM Security Knowledge

    Jul 20, 2026Shufan Chai, Liangliang Sun, Jessica StaddonLLM AuditingLLMs for Cybersecurity

  46. Evaluating Open-Weight LLMs for Generating Structured Threat Information for Autonomous Vehicle Vulnerabilities

    Jul 17, 2026Md Erfan, Ahmed Ryan, Md Kamal Hossain Chowdhury +1CybersecurityLLMs for Cybersecurity

  47. AutoTrace: From Patches to Triggers via Agentic Interprocedural Exploration

    Jul 13, 2026Arastoo Zibaeirad, Marco Vieira, Thomas ZimmermannSoftware Vulnerability DetectionStatic Code Analysis

  48. SMETA-ZSL:Semantic Meta-Alignment for Zero-Shot Threat Classification

    Jul 10, 2026Ivan Alejandro Montoya Sanchez, Anantaa Kotal, Aritran PiplaiZero-Shot LearningCyber Threat Intelligence

  49. From Legacy Documentation to OSCAL: An MCP-Based Agent Pipeline for Threat-Informed Continuous Compliance in Critical Infrastructure

    Jul 9, 2026Lea Roxanne Muth, Marian MargrafCybersecurityLLMs for Cybersecurity

  50. Large Language Models (LLMs) and Generative AI in Cybersecurity and Privacy: A Survey of Dual-Use Risks, AI-Generated Malware, Explainability, and Defensive Strategies

    Jul 8, 2026Kiarash Ahi, Saeed ValizadehLLM SecurityLLMs for Cybersecurity

  51. Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

    Jul 7, 2026Mingchen Li, Meikang Qiu, Zifan Peng +4Software Vulnerability DetectionLLMs for Cybersecurity

  52. TACTIC-KG: Toward Small Agent Teams for Cyber Threat Intelligence Knowledge Graph Construction

    Jul 6, 2026Mouhamed Amine Bouchiha, Gregory BlancKG ConstructionMulti-Agent LLM Systems