LLMs for Cybersecurity

LLM: Large Language Model

Momentum

19 papers in the last four weeks, up 280% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 166

All topics
CardsList
  1. Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions

    Jul 3, 2026Eduardo Almeida Palmieri, Mohamed Chahine Ghanem, Dipo Dunsin +3LLM Agent EvaluationLLMs for Cybersecurity

  2. Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI

    Jul 3, 2026Romain Gerard, Assmaa Zeghaider, Yan GuoLLM Agent OrchestrationLLM Agent Evaluation

  3. AI-Generated PowerShell Malware: An Experimental Framework and Dataset

    Jun 29, 2026Luciano Pianese, Vittorio Orbinato, Pietro Liguori +1LLMs for CybersecurityMalware Analysis

  4. COHORT: Collaborative Orchestration for Hardening via Offensive Replay on Emulated Topologies

    Jun 29, 2026Chen Frydman, Aviram Zilberman, Rubin Krief +6Autonomous Cyber DefenseCybersecurity

  5. Cybersecurity is the True Frontier for Generative AI Success or Failure

    Jun 27, 2026Edward Raff, Maor Ashkenazi, Sagar Samtani +2CybersecurityLLMs for Cybersecurity

  6. Decomposing Memorization Reduction in Privacy-Preserving Fine-Tuning of SLMs for CSIRTs

    Jun 26, 2026Cristhian Kapelinski, Diego KreutzPrivacy-Preserving Language ModelsMemorization in Language Models

  7. LLM agents security duality: a comprehensive survey of self-security and empowered cybersecurity

    Jun 26, 2026Yiwei Xu, Yong Zhuang, Xuanming Liu +6Autonomous Cyber DefenseLLM Agent Security

  8. Helpful or Harmful? Evaluating LLM-Assisted Vulnerability Patching via a Human Study

    Jun 24, 2026Giulian Biolo, Michael Tezza, Yuanjun Gong +1Automated Program RepairHuman-in-the-Loop Evaluation

  9. An Approach for a Supporting Multi-LLM System for Automated Certification Based on the German IT-Grundschutz

    Jun 24, 2026Lea Roxanne Muth, Marian MargrafCybersecurityLLMs for Cybersecurity

  10. CNnotator: LLM-Guided Memory Safety Annotation Synthesis

    Jun 20, 2026Twain Byrnes, Mike DoddsLLM-Assisted AnnotationProgram Synthesis

  11. Evaluating LLMs for Real-World Web Vulnerability Detection

    Jun 19, 2026Sebastian Neef, Luca Jungnickel, Antonio Benjamin Buchholz +2Software Vulnerability DetectionLLM Reliability

  12. Honeyquest for LLMs: Rethinking Cyber Deception for AI Attackers

    Jun 19, 2026Kerri Prinos, Lilianne Brush, Cameron DentonCybersecurityAI Agent Security

  13. Multi-View Decompilation for LLM-Based Malware Classification

    Jun 18, 2026Bercan Turkmen, Vyas RainaSoftware Reverse EngineeringLLM Prompting

  14. Secure Coding Drift in LLM-Assisted Post-Quantum Cryptography Development: A Gamified Fix

    Jun 17, 2026R. D. N. Shakya, C. P. Wijesiriwardana, S. M. Vidanagamachchi +1LLMs for CybersecuritySecure Code Generation

  15. Code-Augur: Agentic Vulnerability Detection via Specification Inference

    Jun 17, 2026Zhengxiong Luo, Mehtab Zafar, Dylan Wolff +1Automated Software TestingSoftware Vulnerability Detection

  16. Evaluating Open-Source LLMs for Multi-Label ATT&CK Technique Classification on CTI Reports

    Jun 16, 2026Ahmed Ryan, Saad Sakib Noor, Md Erfan +3LLM EvaluationCyber Threat Intelligence

  17. Security and Privacy Prompts in the Wild: What Users Ask LLMs and How LLMs Respond

    Jun 16, 2026Hobin Kim, Xiaoyuan Wu, Omer Akgul +2LLM AuditingLLM Reliability

  18. Data-Centric Benchmarking of Exploit Generation in LLMs: Understanding the Impact of Fine-Tuning

    Jun 13, 2026Yiwei Chen, Lichi Li, Kai Cheung +2LLM EvaluationLLM Fine-Tuning

  19. The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI Systems

    Jun 11, 2026Jiaqi Luo, Jiarun Dai, Zhile Chen +8LLM EvaluationAI Agent Security Benchmarks

  20. Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirical Assessment

    Jun 10, 2026Derek Yohn, Luke Flancher, Mirajul Islam +1Software Vulnerability DetectionLLM Agent Evaluation

  21. Do LLMs Make Neural Distinguishers Wise?

    Jun 9, 2026Tatsuya Sakagami, Masashi Hisai, Naoto YanaiLLMs for CybersecurityPrompt Engineering

  22. Benchmarking and Exploring the Capabilities of LLMs for Attack Investigations

    Jun 9, 2026Aniket Anand, Yiwei Hou, Daniel Fields +4LLM EvaluationCybersecurity

  23. SAGE: An LLM-driven Self Reflective Agentic Framework for Fraud Detection

    Jun 6, 2026Yichen Chen, Siying Li, Yuhang Liang +2Multi-Agent LLM SystemsFinancial Fraud Detection

  24. GenTI: Benchmarking LLMs for Autonomous IDPS Rule Generation for Unseen Attacks

    Jun 4, 2026Hassan Jalil Hadi, Rehana Yasmin, Ali ShokerNetwork Intrusion DetectionSynthetic Benchmark Generation

  25. Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration

    Jun 3, 2026Cristina Carleo, Pietro Liguori, Naghmeh Ivaki +1LLM Safety AlignmentLLMs for Cybersecurity

  26. Large Byte Model: Teaching Language Models About Compiled Code

    Jun 1, 2026Florian Störtz, Catalin-Andrei Stan, Alexandru Dinu +4Malware ClassificationByte-Level Language Model

  27. IstGPT: LLM-based Anomaly Detection for Spatial-Temporal Graph in Industrial Systems

    Jun 1, 2026Yuchen Zhang, Ning Xi, Pengbin Feng +5Cyber-Physical SystemsIndustrial Anomaly Detection

  28. A New Framework for Cybersecurity Refusals in AI Agents

    May 31, 2026Eliot Krzysztof Jones, Mateusz Dziemian, Matt Fredrikson +1LLM Agent EvaluationLLM Refusal Behavior

  29. Honeyval: A Comprehensive Evaluation Framework for LLM-powered HTTP Honeypots

    May 28, 2026Mark Vero, Fabian Kaczmarczyck, Ivan Petrov +6LLMs for Cybersecurity

  30. Dissecting the Black Box: Circuit-Level Analysis of LLM Vulnerability Detection

    May 28, 2026Syafiq Al Atiiq, Chun Zhou, Christian GehrmannLLM InterpretabilitySoftware Vulnerability Detection

  31. Intelligent Detection and Mitigation of Carpet-Bombing DDoS Attacks in SDN Using Retrieval-Augmented Generation and Large Language Models

    May 25, 2026Mohammed N. Swileh, Shengli Zhang, Kai LeiNetwork Intrusion DetectionCybersecurity

  32. CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly

    May 25, 2026Yihe Fan, Changyi Li, Lichen Xu +4LLM Agent Self-ImprovementAutomated Penetration Testing

  33. TTPrint: Evidence-Grounded TTP Extraction via Diverge-then-Converge Verification

    May 25, 2026Yutong Cheng, Changze Li, Raihan Sultan Pasha Basuki +3Cyber Threat IntelligenceDocument Information Extraction

  34. APT-Agent: Automated Penetration Testing using Large Language Models

    May 24, 2026William Guanting Li, Alsharif Abuadbba, Kristen Moore +1LLM Hallucination MitigationAutomated Penetration Testing

  35. CyberMaskQA: A Privacy-Aware Benchmark for Evaluating Large Language Models in Cybersecurity Question Answering

    May 23, 2026Matilda Gaddi, Jin Noh, Onat Gungor +1CybersecurityLLMs for Cybersecurity

  36. Demystifying the Mythos or Disrupting Bugonomics? From Zero-Day Asymmetry to Defender Remediation Throughput

    May 23, 2026Alfredo Pesoli, Herman Errico, Lorenzo CavallaroSoftware Vulnerability DetectionSoftware Security

  37. HIDBench: Benchmarking Large Language Models for Host-Based Intrusion Detection

    May 20, 2026Danyu Sun, Jinghuai Zhang, Yuan Tian +1LLM EvaluationCybersecurity

  38. PocketAgents: A Manifest-Driven Library of Autonomous Defense Agents

    May 20, 2026Sidnei Barbieri, Ágney Lopes Roth Ferraz, Lourenço Alves Pereira JúniorAutonomous Cyber DefenseLLM Agent Security

  39. GenAI-Driven Threat Detection with Microsoft Security Copilot

    May 20, 2026Scott Freitas, Amir GharibAutonomous Cyber DefenseCybersecurity

  40. Benchmarking Mythos-Linked Bug Rediscovery

    May 17, 2026Isaac David, Arthur GervaisSoftware EngineeringSoftware Vulnerability Detection

  41. GRID: Graph Representation of Intelligence Data for Security Text Knowledge Graph Construction

    May 15, 2026Liangyi Huang, Zichen Liu, Fei Shao +5KG ConstructionCyber Threat Intelligence

  42. Context, Reasoning, and Hierarchy: A Cost-Performance Study of Compound LLM Agent Design in an Adversarial POMDP

    May 15, 2026Igor Bogdanov, Chung-Horng Lung, Thomas Kunz +3Multi-Agent LLM SystemsLLM Agent Orchestration