Toxicity

Momentum

3 papers in the last four weeks, level with the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 49

All topics
CardsList
  1. SMILESGNN: Interpretable Clinical Toxicity Prediction via SMILES-Graph Cross-Attention Fusion

    Sep 23, 2026Quang Minh Nguyen, Thuy Quynh Nguyen, Duc Minh Le +3Absorption, Distribution, Metabolism, And ExcretionToxicity

  2. Analysis of Prompt Engineering for Drug Toxicity Prediction

    Sep 3, 2026Mia MacGregor, Aakash Welgamage Don, Mark BartlettAbsorption, Distribution, Metabolism, And ExcretionAutomatic Prompt Optimization

  3. ToxLens: A Reproducible Graph-Learning Framework for Leakage-Aware, Uncertainty-Calibrated Molecular Toxicity Prediction

    Aug 31, 2026Magnus H. Strømme, Alex G. C. de Sá, David B. AscherAbsorption, Distribution, Metabolism, And ExcretionToxicity

  4. ConVAWG: A Retrieval-Grounded Framework for Controlled Synthetic Dialogue Generation in Violence Against Women and Girls

    Aug 11, 2026Chen Lyu, Xingwei Tan, Simon Cullen +4Conversational DatasetsChild Sexual Abuse Material

  5. A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models

    Aug 3, 2026Shu Quan, Tianfang Hao, Sitong Fang +8Large Language Model SafetyToxicity

  6. ToxScreen: Detecting Whether an LLM Has Been Poisoned

    Jul 29, 2026Anthony Hughes, Nicole Xing, Collin Francel +2Fewer Surprising BackdoorsToxicity

  7. Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

    Jul 27, 2026Xinnuo Xu, Anja Thieme, Daniela Massiceti +6ToxicityAdversarial Prompts

  8. A Scale-adaptive Vision Model Links C. elegans Neuronal Morphology to Behavior for Neurotoxicity Assessment

    Jul 25, 2026Haochao Ying, Shenchong Lv, Yutao Sun +8MorphogenesisNeurons

  9. Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining

    Jul 25, 2026Rares A. C. Diaconescu, Iulia Slanina, Alina Florea +5ToxicityHarmful Language

  10. Analyzing Toxic Behavior and Its Impact on the Mastodon Community

    Jul 24, 2026Pasan Kamburugamuwa, Scrivner, Olga BToxicityContent Moderation

  11. Conditional Reliability of Toxicity Signals for Multilingual and Code-Mixed Abuse Detection

    Jul 17, 2026Indraveni Chebolu, Rohan Singh, Arnab Mallick +1ToxicityContent Moderation

  12. Safe Alone, Unsafe Together: Safeguarding Against Implicit Toxicity When Benign Images Combine

    Jul 1, 2026Jiaxian Lv, Shiyao Cui, Yingkang Wang +3Content ModerationToxicity

  13. DriftGuard: Safety-Aware Multi-Monitor Detection and Selective Adaptation for Evolving Toxicity Moderation

    Jun 27, 2026Yuting Xin, Hanyu Cai, Binqi Shen +2ToxicityContent Moderation

  14. ToxiREX: A Dataset on Toxic REasoning in ConteXt

    Jun 26, 2026Stefan F. Schouten, Ilia Markov, Piek VossenHarmful LanguageToxicity

  15. A Survey of Toxicity Detection and Mitigation Strategies for Multilingual Language Models

    Jun 24, 2026Soham Dan, Himanshu Beniwal, Thomas HartvigsenMultilingual SafetyLarge Language Model Safety

  16. Distributed Quality-Diversity Search for Toxicity in Large Language Models

    Jun 23, 2026Onkar Shelar, Travis DesellToxicityLarge Language Model Safety

  17. OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

    Jun 19, 2026Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai +2ToxicityRed-Teaming

  18. The Tone of Awareness: Topic, Sentiment, and Toxicity Maps During Mental Health Month on TikTok

    Jun 11, 2026Henrique Ferraz de Arruda, Andreia Sofia Teixeira, Pranay Gundala Reddy +3Mental HealthToxicity

  19. Unsupervised Pattern Analysis in Japanese Veterinary Toxicology: A Regulatory-Compliant Framework for Cross-Species Risk Assessment

    Jun 4, 2026Yukiko Kawakami, Mohammad Shirazi, Ryo Shimizuwa +3Drug-Drug InteractionsToxicity

  20. TriEval: A Resource-Efficient Pipeline for LLM Bias, Toxicity, and Truthfulness Assessment

    Jun 2, 2026Akshatha Srikantha, Manpreet Singh, Yash Jajoo +1Large Language Model EvaluationLarge Language Model Bias

  21. Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models

    May 27, 2026Himanshu Beniwal, Mayank SinghToxicityLarge Language Model Safety

  22. Model Unlearning Objectives Vary for Distinct Language Functions

    May 26, 2026Berk Atil, Vipul Gupta, Rebecca J. PassonneauLarge Language Model UnlearningLarge Language Model Safety

  23. LipoAgent: Coordinating Fine-Tuned LLM Agents for Safer Lipid Design

    May 24, 2026Leshu Li, An Lu, Haiyu Wang +5ToxicityLarge Language Model Agents

  24. Harder to Defend: Towards Chinese Toxicity Attacks via Implicit Enhancement and Obfuscation Rewriting

    May 21, 2026Jingyi Kang, Junyu Lu, Bo Xu +4ToxicityLarge Language Model Evaluation

  25. Toxicity in Twitch Chats: An LLM-Based Analysis Across Gaming Communities

    May 18, 2026Ronja Fuchs, Florian Rupp, Timo Bertram +2Toxicity

  26. State Contamination in Memory-Augmented LLM Agents

    May 16, 2026Yian Wang, Agam Goyal, Yuen Chen +1Large Language Model AgentsHarmful Language

  27. Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study

    May 13, 2026Mokshit Surana, Archit Rathod, Akshaj SatishkumarLarge Language Model SafetyToxicity

  28. MolDeTox: Evaluating Language Model's Stepwise Fragment Editing for Molecular Detoxification

    May 12, 2026Jueon Park, Wonjune Jang, Jiwoo Lee +2ToxicityDetoxification

  29. Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers

    May 11, 2026Nikita Kezins, Urbas Ekka, Pascal Berrang +1Large Language Model SafetyToxicity

  30. Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks

    May 11, 2026Regina Gugg, Selina Niederländer, Andreas Stöckl +1Large Language Model EvaluationToxicity

  31. Automated Detection of Abnormalities in Zebrafish Development

    May 11, 2026Sarath Sivaprasad, Hui-Po Wang, Anna-Lisa Jäckel +4MorphogenesisMicroscopy

  32. An explainable hypothesis-driven approach to Drug-Induced Liver Injury with HADES

    May 4, 2026Maciej Wisniewski, Bartosz Topolski, Pawel Dabrowski-Tumanski +2Absorption, Distribution, Metabolism, And ExcretionCholangiocarcinoma

  33. Bye Bye Perspective API: Lessons for Building and Governing Measurement Infrastructure

    Apr 28, 2026David Hartmann, Manuel Tonneau, Angelie Kraft +7Large Language Model EvaluationToxicity

  34. Detoxification for LLM: From Dataset Itself

    Apr 21, 2026Wei Shao, Yihang Wang, Gaoyu Zhu +4DetoxificationToxicity

  35. Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF

    Apr 20, 2026Yuan Fang, Yiming Luo, Aimin Zhou +1Adversarial PromptsToxicity

  36. CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification

    Apr 16, 2026Yian Wang, Yuen Chen, Agam Goyal +1DetoxificationHarmful Language

  37. Learning Diagnostic Reasoning for Decision Support in Toxicology

    Mar 31, 2026Nico Oberländer, David Bani-Harouni, Tobias Zellner +3LLM Reasoning StrategiesToxicity

  38. Toxicity Assessment in Preclinical Histopathology via Class-Aware Mahalanobis Distance for Known and Novel Anomalies

    Feb 2, 2026Olga Graf, Dhrupal Patel, Peter Groß +3Digital PathologyFalse-Negative Rate

  39. Test-Time Detoxification without Training or Learning Anything

    Jan 14, 2026Baturay Saglam, Dionysis KalogeriasToxicityDetoxification

  40. SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

    Dec 17, 2025Hongbo Wang, AprilPyone MaungMaung, Isao EchizenToxicityLarge Language Model Safety

  41. Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content

    Sep 16, 2025Shaz Furniturewala, Arkaitz ZubiagaToxicityContent Moderation

  42. ToxSyn-PT: A Synthetic Fine-Grained Dataset of Minority-Targeted Toxic Language in Portuguese

    Jun 11, 2025Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Farber +2Hate Speech DetectionNatural Language Datasets

  43. Learning diverse attacks on large language models for robust red-teaming and safety tuning

    May 28, 2024Seanie Lee, Minsu Kim, Lynn Cherif +8Attacker Large Language ModelRed-Teaming