Malicious Agents

Momentum

11 papers in the last four weeks, up 38% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 103

All topics
CardsList
  1. Before Agent Tells The Lie: Has Deception Already Been Represented?

    Oct 5, 2026Xinling Li, Dadi Guo, Qingyu Liu +5DeceptionArtificial Intelligence Detection

  2. Runaway Reaction: When Benign Skills Compose into Malicious Behavior

    Oct 5, 2026Zunlong Zhou, Ziyuan Yang, Mengyu Sun +1Malicious Agents

  3. Pretext: Defeating Malicious Skill Detection Frameworks for AI Agents

    Sep 30, 2026Tobias Kaisar, Aritra DharMalicious AgentsAttacker Large Language Model

  4. ActionGuard: Tool Call Authorization under Poisoned Skills

    Sep 30, 2026Jihun Han, Yejin Jang, Byung Il Kwak +1Tool InvocationAuthorization

  5. Hiding in Plain Sight: Decoupling Pretext from Actuation for Skill Poisoning in LLM Agents

    Sep 30, 2026Wenxin Wu, Lingyong Yan, Lei Sha +2PoisoningMalicious Agents

  6. MiniRep: Robust Reputation-Based Aggregation for Multi-Agent Debate

    Sep 30, 2026Jiaming Zhang, Yuwan Liu, Yue Huang +1Multi-Agent DebateReputation

  7. Faithful Dual-constrained Erasure for Robust LLM Safety Alignment

    Sep 30, 2026Jiaqing Li, Shide Zhou, Zhibo Zhang +3Large Language Model UnlearningLarge Language Model Safety

  8. SKILLLITE: Evidence-Guided Malicious Skill Auditing with Compact LLMs

    Sep 29, 2026Haoran Ou, Gelei Deng, Xuanye Zhang +3Malicious AgentsSkills

  9. Quantization Enables Private Dense Retrieval against Malicious Service Providers

    Sep 28, 2026Louis Tremblay Thibault, Sofiane Azogagh, Marc-Olivier Killijian +1Retrieval LayerPrivacy

  10. The Privacy Fallacy of Crowdsourced Fine-Tuning: Extracting Proprietary Data via Topic-Based Poisoning

    Sep 27, 2026Sae Furukawa, Alina OpreaModel Fine-TuningPoisoning

  11. Delphi Scanner: efficient and interpretable static malware detection via API sequence modeling

    Sep 17, 2026Bijied Brahimi, Vincent Cohadon, Gabriel Glazman +3MalwareMalicious Agents

  12. A Blind Trust, the Bloody Thrust: When Attacker-Controlled Hook Updates Steer AI Agent Harnesses towards Malicious Behaviors

    Sep 3, 2026Pengxun Li, Litian Zhang, Jianwei Hou +4Malicious AgentsArtificial Intelligence Agents

  13. Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents

    Sep 1, 2026Xiaofang Yang, Ziqi Miao, Dianbo Sui +2Runtime Safety FilteringMalicious Agents

  14. EvoSkill Injection: Red-Teaming Autonomous Skill Generation and Evolution in Self-Evolving Agents

    Aug 31, 2026Doyun Kim, Chanwoo Kim, Sugyeong Eo +2Self-Evolving AgentsMalicious Agents

  15. Discovering Persistent Behavioural Patterns for Interpretable Blockchain Forensics

    Aug 13, 2026Dorottya Zelenyanszki, Zhe Hou, Kamanashis Biswas +1BlockchainMalicious Agents

  16. Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents

    Aug 13, 2026Xutao Mao, Liangjie Zhao, Xiang Zheng +1Large Language Model AgentsMalicious Agents

  17. ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners

    Aug 10, 2026Puyu Zeng, Simeng Qin, Jingzhi Li +3Malicious AgentsMulti-Llm Agents

  18. ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger-Rule Optimization

    Aug 10, 2026Hao Sui, Simeng Qin, Jie Liao +3Clean Label Backdoor AttackMalicious Agents

  19. SkillsMetric: Mapping the Detection Boundary of Static Analysis for Malicious Agent Skills

    Aug 9, 2026Xinze Chen, Chi Zhang, Ping Ji +1Malicious AgentsTaxonomy-Driven Dataflow Model

  20. Robust Context-Aware Detection of Malicious Instructions in Text

    Aug 5, 2026Buzhao Liu, Xinhang Ma, Yevgeniy VorobeychikAttacker Large Language ModelIndirect Prompt Injection

  21. IMMENSE: Inductive Multi-perspective User Classification in Social Networks

    Aug 5, 2026Francesco Benedetti, Antonio Pellicani, Gianvito Pio +1Social MediaUser Modeling

  22. SafeFlow: Semantic Information-Flow Control for Blocking Malicious Propagation in Multi-Agent Systems

    Jul 28, 2026Haowen Dai, Zonghao Ying, Wenfeng Li +10Information-Flow ControlMalicious Agents

  23. False Prophets: On the Security of World Models in Agentic Systems

    Jul 25, 2026Erik Imgrund, Anna Wimbauer, Klim Kireev +1World ModelsSecurity

  24. IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests

    Jul 22, 2026Ankur Singh, Jinqiu Yang, Tse-Hsun ChenCoding AgentsVulnerable Code

  25. Integrity of peer-to-peer distributed LLM inference under malicious nodes

    Jul 21, 2026Mert Cihangiroglu, Antonino NoceraPeer-To-PeerLarge Language Model Reliability

  26. CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization

    Jul 21, 2026Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad +4Prompt-Injection DetectorsAutomatic Prompt Optimization

  27. How Do You Choose Your AI Component? An Interview Study of Secure AI Integration in Practice

    Jul 18, 2026Mahzabin Tamanna, Elizabeth Lin, Sparsha Gowda +2Artificial Intelligence SystemsInterviews

  28. ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

    Jul 11, 2026Kefan Song, Yanjun QiAgentic DeploymentsMalicious Agents

  29. Detecting Ladder Logic Bombs in IEC 61131-3 PLC Programs using ESBMC-PLC+: A Formal Verification Approach with Trigger Synthesis

    Jul 9, 2026Pierre Dantas, Lucas Cordeiro, Waldir JuniorFormal VerificationLadder

  30. When Agents Go Rogue: Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems

    Jul 7, 2026Haowen Xu, Xue Tan, Lei Ma +6Malicious AgentsLarge Language Model Backbones

  31. CONTRA: Red-Teaming Configurations of Personalizable Agents

    Jul 3, 2026Jonathan Nöther, Adish Singla, Goran RadanovicRed-TeamingMalicious Agents

  32. Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

    Jul 2, 2026William Hackett, Peter GarraghanGuardrailLarge Language Model Safety

  33. Jailbreaking for the Average Jane: Choosing Optimal Jailbreaks via Bandit Algorithms for Automatically Enhanced Queries

    Jun 25, 2026Prarabdh Shukla, Ritik, Suhas Rao +2Jailbreak AttacksMalicious Agents

  34. Model Forensics: Investigating Whether Concerning Behavior Reflects Misalignment

    Jun 24, 2026Aditya Singh, Gerson Kroiz, Senthooran Rajamanoharan +1Agent Behavior ModelingDigital Forensics

  35. Detecting Malicious Agent Skills in the Wild using Attention

    Jun 22, 2026Bacem Etteib, Daniele Lunghi, Tégawendé F. BissyandéMalicious AgentsSkills

  36. When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

    Jun 22, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangIndirect Prompt InjectionMultimodal Evaluation

  37. SCRUB-FL: Sanitizing and Cleansing Representations via Unlearning of Backdoors

    Jun 21, 2026Osama Wehbi, Sarhad Arisdakessian, Omar Abdel Wahab +2Clean Label Backdoor AttackFederated Learning

  38. Multi-View Decompilation for LLM-Based Malware Classification

    Jun 18, 2026Bercan Turkmen, Vyas RainaDisassemblyMalware

  39. Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code

    Jun 10, 2026Yitong Zhang, Shiteng Lu, Jia LiLarge Language Model JailbreaksJailbreak Attacks

  40. POISE: Position-Aware Undetectable Skill Injection on LLM Agents

    Jun 6, 2026Haochang Hao, Dehai Min, Zhifang Zhang +4PoisoningMalicious Agents

  41. Adversarial Creation and Detection of AI-Generated Social Bot Content

    Jun 5, 2026Mykola Trokhymovych, Ricardo Baeza-Yates, Alessandro Flammini +2Ai-Generated Content DetectionGenerative Artificial Intelligence

  42. TRACE: Trajectory Reasoning through Adaptive Cross-Step Evidence Aggregation for LLM Agents

    Jun 5, 2026Vijitha Mittapalli, Shreyaa Jayant Dani, Satya Srujana Pilli +7TracesTrajectory-Level Credit

  43. Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?

    Jun 4, 2026Jingheng Ye, Huiqi Zou, Simon Yu +1SabotageCoding Agents

  44. Outsmarting the Chameleon: Counterfactual Decoupling for Tactical OOD Shifts in Live Streaming Risk Assessment

    Jun 1, 2026Yiran Qiao, Jing Chen, Jiaqi Xu +3Out-Of-DistributionStreaming Video

  45. SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction

    Jun 1, 2026Yuting Ning, Zhehao Zhang, Yash Kumar Lal +8Malicious AgentsAgentic Workflows

  46. Investigating and Alleviating Harm Amplification in LLM Interactions

    Jun 1, 2026Ruohao Guo, Wei Xu, Alan RitterLarge Language Model SafetyHarms

  47. ClawHub Security Signals: When VirusTotal, Static Analysis, and SkillSpector Disagree

    May 31, 2026Vincent Koc, Patrick Erichsen, Jacob Tomlinson +3Malicious AgentsMalware

  48. Inference Cost Attacks for Retrieval-Augmented Large Language Models

    May 31, 2026Chengliang Liu, Liangbo Ning, Yujuan Ding +1Agentic Retrieval-Augmented Generation SystemsAttacker Large Language Model

  49. Benchmarking Security Risk Detection and Verification in Open Agentic Skill Ecosystems

    May 30, 2026Ismail Hossain, Sai Puppala, Zhuoran Lu +2Malicious AgentsReusable Agent Skills