Content Moderation

Momentum

9 papers in the last four weeks, up 200% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 78

All topics
CardsList
  1. From Abusive Language Classification to Sequence Labeling Identification

    Oct 5, 2026Nicolas Zampieri, Ignacio Lopez, Manon Girard +1Content Moderation

  2. Continual Concept Erasure in Diffusion Models by Suppressing Cross-Edit Interference

    Oct 1, 2026Yongliang Wu, Haori Lu, Jinqi Luo +3Concept ErasureText-To-Image Diffusion Models

  3. ReSolve: Reusing Candidate Reasoning through Selective Generative Moderation

    Oct 1, 2026Bangji Yang, Jiajun Fan, Hongba Ma +6CandidateEfficient Inference

  4. Look What You Made Us Cluster: Hate Narrative Extraction from Reddit Discourse

    Sep 29, 2026Annabelle K. L. Chua, Forster J. Khoo, Joel C. R. Tan +8Hate Speech DetectionHate Speech

  5. Nürnberg NLP at ChildSafeAds 2026: Structurally Dissimilar Voter Ensembles under Four Levels of Data Access

    Sep 28, 2026Philipp Steigerwald, Eric Rudolph, Jens AlbrechtContent ModerationMajority Voting

  6. AI-Moderated Interviews for Market Research and Digital Twins Calibration

    Sep 24, 2026Yuting Deng, Jingxuan Liu, Olivier Toubia +1InterviewsSurvey

  7. An Explainable DistilBERT-BiLSTM-Attention Framework for Binary and Multi-Class Hate Speech Detection

    Sep 23, 2026Rameesha Zia, Muhammad Shahid Iqbal MalikHate Speech DetectionHate Speech

  8. Learn Before You Judge: Progressive Knowledge-to-Decision Alignment for Explainable Hateful Meme Detection

    Sep 17, 2026Bo Xu, Chenyuan Wang, Xinyu Chen +5Hate Speech DetectionHate Speech

  9. Characterizing Bluesky Content Moderation Service: From Automation of Service to Landscape of Harms

    Sep 12, 2026Pushpdeep Singh, Sayeh Jarollahi, Ayan Majumdar +5Content ModerationModel Auditing

  10. Evaluating Criterion-Conditioned Behaviour of Large Language Models in Content Moderation

    Sep 3, 2026Danting Zhang, Bei Peng, Robert LoftinContent ModerationLarge Language Model Evaluation

  11. Detoxifying Toxic Communication: A Design Science Approach to Responsible AI

    Aug 31, 2026Hossein Arshadi Soufiani, Henry M. Kim, Hjalmar Turesson +2Harmful LanguageDetoxification

  12. SkillZip Pro: Execution-Aware Dynamic Compression of Progressively Loaded Skills for Self-Evolving Agents

    Aug 31, 2026Xiaofan Bai, Chao Liu, Hongqiang Lin +5Unsupervised Skill DiscoveryData Compression Methods

  13. Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

    Jul 30, 2026Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji +2Content ModerationLarge Language Model Safety

  14. RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation

    Jul 29, 2026Benyamin Tafreshian, Prathamesh DhakeLarge Language Model JailbreaksContent Moderation

  15. Contextualized Counterspeech Can Be More Persuasive Than Generic Counterspeech

    Jul 28, 2026Lorenzo Cima, Alessio Miaschi, Amaury Trujillo +3Content ModerationConversational Artificial Intelligence

  16. Shieldstral

    Jul 28, 2026Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli +273Content Moderation

  17. Analyzing Toxic Behavior and Its Impact on the Mastodon Community

    Jul 24, 2026Pasan Kamburugamuwa, Scrivner, Olga BToxicityContent Moderation

  18. Now You See the Hate: Adaptive View Retrieval for Hidden Hateful Illusions

    Jul 21, 2026Qianpu Chen, Derya SoydanerHate Speech DetectionHate Speech

  19. RMS@CC-MMD 2026: Multimodal Misogyny Detection via Geometric Interaction and Multi-View Consensus

    Jul 20, 2026Md. Ajwad HossainMemesMultimodal Sentiment Analysis

  20. Conditional Reliability of Toxicity Signals for Multilingual and Code-Mixed Abuse Detection

    Jul 17, 2026Indraveni Chebolu, Rohan Singh, Arnab Mallick +1ToxicityContent Moderation

  21. Contextualized Early Detection of Online Firestorms: A Sequential LLM-Based Approach

    Jul 16, 2026Besim Shala, Peter Mandl, Andreas Humpe +1Content ModerationThreat Detection

  22. Safe Alone, Unsafe Together: Safeguarding Against Implicit Toxicity When Benign Images Combine

    Jul 1, 2026Jiaxian Lv, Shiyao Cui, Yingkang Wang +3Content ModerationToxicity

  23. How Human Feedback Shapes AI-generated Community Notes

    Jun 29, 2026Soham De, Isaac Slaughter, Jiawei Guo +4Human-Ai CollaborationContent Moderation

  24. Majority Vote Silences Minority Values: Annotator Disagreement at the Hate/Offensive Boundary in HateXplain

    Jun 27, 2026Joshua Muhumuza, Joab Ezra Agaba, Mercy AmiyoHate Speech DetectionDisagreement

  25. DriftGuard: Safety-Aware Multi-Monitor Detection and Selective Adaptation for Evolving Toxicity Moderation

    Jun 27, 2026Yuting Xin, Hanyu Cai, Binqi Shen +2ToxicityContent Moderation

  26. Beyond Surface Forms: A Comprehensive, Mechanism-Oriented Taxonomy of Indirect Linguistic Encoding for LLM-Based Coded Language Detection

    Jun 25, 2026Hamid Reza Firoozfar, Mohammadsadegh Abolhasani, Reza Mousavi +1LinguisticsContent Moderation

  27. Cross-National Information Attacks: A Two-Decade Analysis of Troll Behavior in Korea

    Jun 22, 2026Jaehong Kim, Hyeonseung Kim, Jiseon Kim +4Social InfluenceContent Moderation

  28. Mod-Guide: An LLM-based Content Moderation Feedback System to Address Insensitive Speech toward Indigenous Ethnic and Religious Minority Communities

    Jun 11, 2026Dipto Das, Achhiya Sultana, Ankit Singh Chauhan +5Content ModerationLarge Language Model Bias

  29. YTClickbait21K: Human-Annotated Multimodal Dataset for YouTube Clickbait Detection Across Diverse Channels and Content Categories

    Jun 10, 2026Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar +5Multimodal DatasetContent Moderation

  30. What the Eyes See, the LLMs Miss: Exploiting Human Perception for Adversarial Text Attacks

    Jun 8, 2026Qin Yang, Lu Malloy, Joshua Lee +4Attacker Large Language ModelContent Moderation

  31. Multimodal Sexism Identification and Characterization using Large Language Models and Gradient Boosting

    Jun 4, 2026Kyriakos Chaviaras, Maria Lymperaiou, Athanasios VoulodimosMemesContent Moderation

  32. UNIVID: Unified Vision-Language Model for Video Moderation

    Jun 4, 2026Kejuan Yang, Yizhuo Zhang, Mingyuan Du +6Video CaptioningContent Moderation

  33. When Surface Form Changes Moderation Decisions: A Paired Study of Code-Mixed Workflow Instability

    Jun 4, 2026Suraj Babu Thimma Krishnaram, Yibo Hu, Karthikeyan SaravananContent ModerationCode Quality

  34. Consensus is Strategically Insufficient: Reasoning-Trace Disagreement as a Knowledge-Representation Signal

    Jun 2, 2026Michał Wawer, Jarosław A. ChudziakDisagreementContent Moderation

  35. The Ghost Annotator: a Framework to Explore Human Label Variation in Content Moderation through Conformal Prediction

    Jun 1, 2026Mirko Lai, Alessandra Urbinati, Simona Frenda +2Large Language Model AnnotationsHuman Annotators

  36. FigSIM: A Dataset for Fine-grained Suicide Severity and Figurative Language in Suicide Memes

    Jun 1, 2026Liuliu Chen, Elise R. Carrotte, Brian E. Chapman +2Suicide RiskMemes

  37. ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails

    May 29, 2026Yan Wang, Zhixuan Chu, Zihao Xue +9Large Language Model SafetyEnforcement

  38. Cyberbullying Governance on Social Media: A Unified Framework from Content Identification to Intervention

    May 26, 2026Yiting Huang, Wenting Zhu, Zekun Wang +6Content ModerationSocial Media

  39. Semantic Gradients Interactions in SSD: A Case Study in Racial Identity and Hate Speech

    May 26, 2026Felix Ostrowicki, Hubert PlisieckiHate Speech DetectionHate Speech

  40. AI Content Moderation in Therapy Conversations

    May 25, 2026Jiwon Kim, Claire Wang, Taeung Yoon +2Content ModerationModel Auditing

  41. First, do no harm: Breaking suicidogenic echo chambers in media recommendation

    May 24, 2026Alberto Díaz-Álvarez, Raúl Lara-Cabrera, Fernando Ortega-Requena +1Suicide RiskRecommendation

  42. Multi-Stage Training for Abusive Comment Detection in Indic Languages

    May 21, 2026Pranshu Rastogi, Madhav Mathur, Ramaneswaran S +1Hate Speech DetectionContent Moderation

  43. AOP-Wiki EMOD 3.0: Data Model Expansions and Content Evaluation Framework for Using Agentic AI to Improve Integration between AOPs and New Approach Methodologies (NAMs)

    May 20, 2026Virginia K. Hench, J. Harry Caufield, Sierra A. T. Moxon +2RegulationContent Moderation

  44. Refining and Reusing Annotation Guidelines for LLM Annotation

    May 20, 2026Kon Woo Kim, Jin-Dong Kim, Akiko AizawaLarge Language Model AnnotationsAnnotations

  45. QwenSafe: Multimodal Content Rating Description Identification via Preference-Aligned VLMs

    May 20, 2026Dishanika Denipitiyage, Aruna Seneviratne, Suranga SeneviratneMultimodal EvaluationContent Moderation

  46. Language Mutations Sustain the Persistences of Conspiracy Theories on Social Media

    May 19, 2026Calvin Yixiang Cheng, Dorian Quelle, Scott A. HaleSocial MediaLinguistics

  47. PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media

    May 16, 2026Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan +3Content ModerationInternal Pluralism

  48. The Impact of AI Search on the Online Content Ecosystem: Evidence from Google and Reddit

    May 14, 2026Peibo Zhang, Ruomeng Cui, Dennis J. ZhangSocial MediaContent Moderation

  49. Fine-tuning with Hierarchical Prompting for Robust Propaganda Classification Across Annotation Schemas

    May 13, 2026Lukas Stähelin, Veronika Solopova, Max Upravitelev +6Large Language Model ClassificationContent Moderation