Harmful Content

Momentum

2 papers in the last four weeks, down 50% on the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 32

All topics
CardsList
  1. SCOUT: Synergizing Reasoning and Tool-Use for Computer-Use Safety

    Sep 28, 2026Jianxing Chen, Xiao Yu, Shipra Agrawal +1Safety BenchmarksSecurity Evaluation

  2. The Role of Fine-grained Harm Signals in LLM Safety

    Sep 16, 2026Soyeon Park, Seogyeong Jeong, Sunwoo Kim +1Large Language Model SafetyHarmful Content

  3. Characterizing Bluesky Content Moderation Service: From Automation of Service to Landscape of Harms

    Sep 12, 2026Pushpdeep Singh, Sayeh Jarollahi, Ayan Majumdar +5Content ModerationModel Auditing

  4. The Illusion of Cross-Lingual Safety in Low-Resource Languages

    Aug 11, 2026Abigail Oppong, P Sam Sahil, Tadesse Destaw Belay +12Multilingual SafetyLarge Language Model Safety

  5. Data Attribution of Emergent Misalignment with Persona Features

    Aug 11, 2026Clemens Vetter, David Kaczér, Lucie Flek +1Emergent MisalignmentLarge Language Model Alignment

  6. Harmful Content Is Not Enough: Continuation Framing Moderates In-Context Emergent Misalignment

    Aug 8, 2026Peiyang Liu, Xi Wang, Ziqiang Cui +2Emergent MisalignmentHarmful Content

  7. The Judgment-Consequence Gap: LLM Moral Reasoning in Healthcare Decisions

    Aug 6, 2026Hadi Hosseini, Samarth Khanna, Leona PierceMoral ReasoningClinical Reasoning Training

  8. Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

    Jul 30, 2026Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji +2Content ModerationLarge Language Model Safety

  9. Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

    Jul 27, 2026Xinnuo Xu, Anja Thieme, Daniela Massiceti +6ToxicityAdversarial Prompts

  10. AEGIS: Awareness-Enhanced Guidance for Iterative Safeguard

    Jul 20, 2026Kyungwon Park, Sangmin Lee, Heejae Chon +1DetoxificationMultilingual Safety

  11. Understanding Interpretation Difficulty in Harmful Online Communication: Insights from Cybercrime Communities

    Jul 8, 2026Tomohiro Okatsu, Naoki Takada, Yin Min Pa Pa +2Harmful ContentInterpretation

  12. HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment

    Jul 1, 2026Shei Pern Chua, Hao Wu, Qianli Ma +1Safety AlignmentHarmful Content

  13. Benign in Isolation, Harmful in Composition: Security Risks in Agent Skill Ecosystems

    Jun 13, 2026Yi Xie, Jiawei Du, Yu Cheng +2Agent Skill RetrievalSecurity

  14. Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content

    May 28, 2026Ihor Stepanov, Aleksandr SmechovLarge Language Model SafetyGuardrail

  15. Diagnosing Harmful Continuation in Answer-Correct Long-CoT Training Traces

    May 28, 2026Chen He, Yuhao Wu, Lei Wang +2ContinuationChain-of-Thought Reasoning

  16. Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents

    May 27, 2026Yongxiang Li, Moxin Li, Zhixin Ma +4Attacker Large Language ModelLarge Language Model Agents

  17. AERIC: Anticipatory Hidden-State Monitoring for Implicit Harmful Dialogue

    May 13, 2026Jihyung Park, Saleh Afroogh, Junfeng JiaoLarge Language Model SafetyHarmful Content

  18. Do Linear Probes Generalize Better in Persona Coordinates?

    May 10, 2026Prasad Mahadik, Adrians SkaparsArtificial Intelligence PersonasPersonality

  19. A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models

    May 8, 2026Hamid Kazemi, Atoosa Chegini, Maria SafiSafety AlignmentLarge Language Model Alignment

  20. Characterizing the Consistency of the Emergent Misalignment Persona

    Apr 30, 2026Anietta Weckauff, Yuchen Zhang, Maksym AndriushchenkoEmergent MisalignmentArtificial Intelligence Personas

  21. Test-Time Safety Alignment

    Apr 28, 2026Baturay Saglam, Dionysis KalogeriasSafety AlignmentHarmful Content

  22. LLM Safety From Within: Detecting Harmful Content with Internal Representations

    Apr 20, 2026Difan Jiao, Yilun Liu, Ye Yuan +4Large Language Model SafetyHarmful Content

  23. Beyond Static Benchmarks: Synthesizing Harmful Content via Persona-based Simulation for Robust Evaluation

    Apr 18, 2026Huije Lee, Jisu Shin, Hoyun Song +2Ai-Generated Content DetectionHarmful Content

  24. Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

    Apr 10, 2026Hadas Orgad, Boyi Wei, Kaden Zheng +4Large Language Model SafetyHarmful Content

  25. AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

    Apr 3, 2026Yunhao Feng, Yifan Ding, Yingshui Tan +6Computer-Use AgentsHazard

  26. LLMs Encode Harmfulness and Refusal Separately

    Jul 16, 2025Jiachen Zhao, Jing Huang, Zhengxuan Wu +2Large Language Model SafetyHarmful Content

  27. Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge

    Apr 8, 2024Weikai Lu, Ziqian Zeng, Jianwei Wang +5Large Language Model JailbreaksJailbreaks