cs.CYAug 31, 2026

Detoxifying Toxic Communication: A Design Science Approach to Responsible AI

Authors: Hossein Arshadi SoufianiHenry M. KimHjalmar TuressonSyed Mohammad Arham NomanAnav Setia

Organizations: Schulich School of Business, York University

Abstract

Toxic language in digital workplaces such as pejoratives, sarcasm, condescension, and subtle incivility can erode trust, morale, and collaboration. Existing moderation tools primarily delete or block harmful messages, disrupting communication and offering no constructive resolution. This study adopts a Design Science Research approach to create a responsible AI artifact that detects and detoxifies toxic communication. The artifact integrates fine-tuned transformer-based classifiers (DistilBERT, DistilRoBERTa) with a generative detoxification model (mT0-XL-Detox-ORPO) that rewrites toxic text into semantically equivalent, non-offensive paraphrases. Technical evaluation demonstrates high accuracy in toxicity detection and strong semantic preservation in rewritten messages, supporting conversation continuity while reinforcing respectful discourse. The paper contributes design principles for responsible AI moderation that prioritize meaning preservation and fairness.

Explore similar work

CardsList
  1. Detoxification for LLM: From Dataset Itself

    Apr 21, 2026Wei Shao, Yihang Wang, Gaoyu Zhu +4DetoxificationToxicity