Benign

Momentum

1 paper in the last four weeks, down 67% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 28

All topics
CardsList
  1. Safety of Latent Communication in Multi-Agent Systems

    Sep 30, 2026Muhammad Huzaifa, Sina Mavali, Thorsten EisenhoferSafety AlignmentBenign

  2. When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning

    Sep 1, 2026Yitong Guo, Xiaoyi Chen, Siyuan Zhang +2FragilityModel Fine-Tuning

  3. Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text

    Aug 31, 2026Minkyung Cho, Jihyo Kim, SeungWoo Song +4Synthetic DataBenign

  4. Benign interpolation and Occam's razor

    Aug 4, 2026Tom F. Sterkenburg, Daniel A. Herrmann, Jan-Willem RomeijnStochastic InterpolantsInterpretability

  5. Robust and Personalized Federated Learning for Aircraft-Engine Prognostics under Benign and Adversarial Client Heterogeneity

    Aug 4, 2026Chinmoy Mitra, Md. Mehedi Hasan Nipu, Mohammad Sakib Mahmood +2Federated LearningBalanced Learning

  6. Two Sides of the Same Coin: Learning the Backdoor to Remove the Backdoor

    Jul 7, 2026Qi Zhao, Christian WressneggerPoisoningBenign

  7. Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses

    Jul 6, 2026Neeraj Karamchandani, Piyush Nagasubramaniam, Sencun Zhu +1LLM Reasoning StrategiesLLM Defense Mechanisms

  8. PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement

    Jul 3, 2026Xianren Zhang, Delvin Ce Zhang, Dongwon Lee +1Large Language Model UnlearningMultimodal Large Language Models

  9. Safe Alone, Unsafe Together: Safeguarding Against Implicit Toxicity When Benign Images Combine

    Jul 1, 2026Jiaxian Lv, Shiyao Cui, Yingkang Wang +3Content ModerationToxicity

  10. Defending Against Harmful Supervision Hidden in Benign Samples

    Jun 29, 2026Bang An, Yibo Yang, Dandan Guo +3Supervised FinetuningModel-Agnostic Defense

  11. The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning

    Jun 27, 2026Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm +8Multilingual SafetyLarge Language Model Safety

  12. Misinformation Propagation in Benign Multi-Agent Systems

    Jun 15, 2026Jonas Becker, Jan Philip Wahle, Terry Ruas +1Multi-Agent DebateMisinformation

  13. MIRAGE: A Polarity-Flipping Encoding Subspace in LLM Agents

    Jun 9, 2026Pratibha Revankar, Kargi Chauhan, Jihye Kim +3Attacker Large Language ModelLarge Language Model Agents

  14. SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents

    May 27, 2026Yubin Qu, Yi Liu, Gelei Deng +4Coding AgentsSynthetic Environments

  15. Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts

    May 22, 2026Md Nurul Absar SiddikyMixture-Of-Experts Large Language ModelsLarge Language Model Routing

  16. Learning to Look Benign: Targeted Evasion of Malware Detectors via API Import Injection

    May 18, 2026Juozas Dautartas, Olga Kurasova, Juozapas Rokas Čypas +1MalwareEvasion

  17. Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks

    May 18, 2026Yubin Qu, Ying Zhang, Yanjun Zhang +4Kernel-Resident Tool Governance GatewayCoding Agents

  18. FragBench: Cross-Session Attacks Hidden in Benign-Looking Fragments

    May 10, 2026Astha Mehta, Niruthiha Selvanayagam, Cedric Lam +10Large Language Model SafetyBenign

  19. Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs

    May 9, 2026Sangyeon Yoon, Wonje Jeung, Yoonjun Cho +2BenignRefusals

  20. GESR: Graph-Based Edge Semantic Reconstruction for Stealthy Communication Detection with Benign-Only Training

    May 8, 2026Henghui Xu, Yuchen Zhang, Xiaobo MaGeneralist Graph Anomaly DetectionIntrusion Detection

  21. How Do Answer Tokens Read Reasoning Traces? Self-Reading Patterns in Thinking LLMs for Quantitative Reasoning

    Apr 21, 2026Haoyang Chen, Yi Liu, Jianzhi Shao +3Reasoning TracesLinear Activation Steering

  22. Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

    Apr 17, 2026Jaechul Roh, Virat Shejwalkar, Amir HoumansadrLarge Audio Language ModelsModel Fine-Tuning

  23. Seven Security Challenges in Cross-domain Multi-agent LLM Systems

    May 28, 2025Ronny Ko, Jiseong Jeong, Shuyuan Zheng +4Multi-Agent Large Language Model SystemsLarge Language Model Safety