Red-Teaming

Momentum

5 papers in the last four weeks, level with the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 71

All topics
CardsList
  1. Red-TTT: Test-Time Training for Automated Jailbreaking Large Language Models

    Oct 4, 2026Tongyan Hu, Hao Li, Xiaogeng Liu +8Large Language Model JailbreaksRed-Teaming

  2. No One Architecture Fits All: A Cross-Environment Evaluation of Hierarchical Red Team Agents

    Sep 30, 2026Ayan Javeed Shaikh, Arunesh Sinha, Nathaniel D. Bastian +1Red-TeamingCybersecurity

  3. Climbing the Hill: Prompt Injection Red-Teaming Against Frontier Models with Curriculum Reinforcement Learning

    Sep 27, 2026Chenlong Yin, Xiaolong Jin, Wei Zou +2Attacker Large Language ModelRed-Teaming

  4. Red-Teaming Auto Mode: Improving Blocking Classifiers Against Malign Coding Agents

    Sep 17, 2026Alex Remedios, Simon Storf, Fabien Roger +1Red-TeamingCoding Agents

  5. EvoFlint: An Evolutionary Atlas of Multi-Turn LLM Vulnerabilities

    Aug 31, 2026Feitong Qiao, Liren Peng, Shiming Ren +7Attacker Large Language ModelRed-Teaming

  6. SIR: Self-improving Red-teaming for Compute Use Agents

    Aug 31, 2026Chen Xiong, Zhiyuan He, Pin-Yu Chen +2Indirect Prompt InjectionRed-Teaming

  7. REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems

    Aug 11, 2026Zixing Chen, Xingyuan Liu, Jie Zhu +6Red-TeamingLarge Language Model Agents

  8. Generating Attacks for LLMs with GFlowNets

    Aug 10, 2026Berkay Ozcam, Irem Onen, Mehmet Fatih Amasyali +1Attacker Large Language ModelLarge Language Model Safety

  9. From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

    Aug 10, 2026Yuanhe Zhang, Weiliu Wang, Jie Ren +7Large Audio Language ModelsAudio Understanding

  10. Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

    Aug 5, 2026Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi +6Red-TeamingLarge Language Model Safety

  11. OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

    Aug 1, 2026Yunhao Chen, Xin Wang, Yixu Wang +6Red-TeamingArtificial Intelligence Safety

  12. GPT-Red: Automated Red Teaming via Self-Play at Scale

    Jul 28, 2026Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal +15Red-TeamingAttacker Large Language Model

  13. Code Monitor Red Teaming for Public-Test-Passing Code

    Jul 23, 2026Junchi Liao, Jiawen Deng, Fuji RenCode QualityRed-Teaming

  14. An Early Warning of Emerging Biosecurity Risks in Frontier LLMs

    Jul 20, 2026Zhida He, Xia Hu, Baichen Le +20Large Language Model SafetyLife Sciences Research

  15. Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming

    Jul 13, 2026Xutao Mao, Xiang Zheng, Cong WangRed-TeamingLarge Language Model Agents

  16. AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation

    Jul 13, 2026Yi Ting Shen, Kentaroh Toyoda, Alex LeungRed-TeamingAttack-Success Rate

  17. CONTRA: Red-Teaming Configurations of Personalizable Agents

    Jul 3, 2026Jonathan Nöther, Adish Singla, Goran RadanovicRed-TeamingMalicious Agents

  18. Online Safety Monitoring for LLMs

    Jul 2, 2026Mona Schirmer, Metod Jazbec, Alexander Timans +3Large Language Model SafetyRed-Teaming

  19. A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

    Jun 24, 2026Abrar Alotaibi, Raed Mughus, Moataz AhmedLarge Language Model ReliabilityRed-Teaming

  20. RIFT-Bench: Dynamic Red-teaming For Agentic AI Systems

    Jun 22, 2026Yarin Yerushalmi Levi, Roy Betser, Amit Giloni +5Red-TeamingCyberattacks

  21. REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

    Jun 22, 2026Yifei Zhao, Qian Lou, Mengxin ZhengAdversarial EvaluationRed-Teaming

  22. OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

    Jun 19, 2026Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai +2ToxicityRed-Teaming

  23. NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms

    Jun 18, 2026Hanwool Lee, Dasol Choi, Bokyeong Kim +2Red-TeamingSafety Benchmarks

  24. FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming

    Jun 18, 2026Chaeyun Kim, Daeyoung Park, Junghwan Kim +4Red-TeamingLarge Language Model Safety

  25. Learning Red Agent Policy from Observations for Neurosymbolic Autonomous Cyber Agents

    Jun 16, 2026Ankita Samaddar, Sandeep Neema, Daniel Balasubramanian +1Red-TeamingNeuro-Symbolic Framework

  26. A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models

    Jun 16, 2026Nicola FrancoJailbreak AttacksRed-Teaming

  27. MAStrike: Shapley-Guided Collusive Red-Teaming on Multi-Agent Systems

    Jun 11, 2026Chejian Xu, Zhaorun Chen, Jingyang Zhang +5Multi-Agent CommunicationRed-Teaming

  28. PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections

    Jun 10, 2026Pengfei He, Lesly Miculicich, Vishesh Sharma +5Prompt-Injection DetectorsAttacker Large Language Model

  29. Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

    Jun 8, 2026Blake Bullwinkel, Eugenia Kim, Amanda Minnich +1Red-TeamingLLM Defense Mechanisms

  30. Diffuse AI Control on Fuzzy Tasks

    Jun 8, 2026Mikhail Terekhov, Caglar Gulcehre, Vivek Hebbar +1Artificial Intelligence SafetySabotage

  31. FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors

    Jun 3, 2026Sepehr Dehdashtian, Jacob H Seidman, Vishnu N Boddeti +1Deepfake DetectionAudio Understanding

  32. Attack Selection in Agentic AI Control Evaluations Meaningfully Decreases Safety

    Jun 3, 2026Catherine Ge-Wang, Tyler Crosse, Benjamin Hadad +3Artificial Intelligence SafetyArtificial Intelligence Control

  33. Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South

    May 18, 2026Charvi Rastogi, Mukul Bhutani, Minsuk Kahng +13Multilingual SafetyRed-Teaming

  34. Proteus: A Self-Evolving Red Team for Agent Skill Ecosystems

    May 12, 2026Zhaojiacheng ZhouRed-TeamingSkills

  35. Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

    May 12, 2026Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed +1Red-TeamingAdversarial Evaluation

  36. Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers

    May 11, 2026Nikita Kezins, Urbas Ekka, Pascal Berrang +1Large Language Model SafetyToxicity

  37. Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw

    May 11, 2026Hongwei Yao, Yiming Liu, Yiling He +1OpenclawSecurity Evaluation

  38. MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring

    May 10, 2026Monika Jotautaitė, Maria Angelica Martinez, Ollie Matthews +1Red-TeamingCoding Agents

  39. The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring

    May 9, 2026Ismail Hossain, Tanzim Ahad, Md Jahangir Alam +3Jailbreak AttacksJailbreaks

  40. OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents

    May 9, 2026Xinyu Li, Ronghui Mu, Lin Li +2LLM Reasoning StrategiesDistributed Denial-Of-Service

  41. LoopTrap: Termination Poisoning Attacks on LLM Agents

    May 7, 2026Huiyu Xu, Zhibo Wang, Wenhui Zhang +4Large Language Model AgentsPoisoning

  42. PersonaTeaming: Supporting Persona-Driven Red-Teaming for Generative AI

    May 7, 2026Wesley Hanwen Deng, Mingxi Yan, Sunnie S. Y. Kim +5Red-TeamingHuman-Ai Collaboration

  43. DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents

    May 6, 2026Zhaorun Chen, Xun Liu, Haibo Tong +14Red-TeamingArtificial Intelligence Agents

  44. Redefining AI Red Teaming in the Agentic Era: From Weeks to Hours

    May 5, 2026Raja Sekhar Rao Dheekonda, Will Pearce, Nick LandersRed-TeamingOpen-Source

  45. ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational Priming

    May 4, 2026Mario Rodríguez Béjar, Francisco J. Cortés-Delgado, S. Braghin +1Large Language Model JailbreaksRed-Teaming

  46. Training a General Purpose Automated Red Teaming Model

    Apr 24, 2026Aishwarya Padmakumar, Leon Derczynski, Traian Rebedea +1Red-TeamingAttacker Large Language Model

  47. RedVLA: Physical Red Teaming for Vision-Language-Action Models

    Apr 24, 2026Yuhao Zhang, Borong Zhang, Jiaming Fan +4Red-TeamingUnsafe

  48. AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

    Apr 23, 2026Tanmay Gautam, Alireza Bahramali, Sandeep AtluriRed-TeamingAttacker Large Language Model