Harms

Momentum

8 papers in the last four weeks, up 100% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 62

All topics
CardsList
  1. Tool Mediation Alters Refusal Mechanisms in Large Language Models

    Sep 28, 2026Abel Rodríguez, Giuseppe Garofalo, Lieven Desmet +1Large Language Models FailRefusals

  2. From Attack Success to Attack Severity: Counterfactual Memory Attacks on LLM Agents

    Sep 28, 2026Mingxi Zou, Langzhang Liang, Zhuo Wang +3Large Language Model AgentsHarms

  3. Path-specific harm decomposition: A partial identification framework

    Sep 24, 2026Ruizi Yan, Dennis Frauen, Maresa Schröder +1Causal Mediation AnalysisHarms

  4. When Post-Processing Fairness Constraints Help and When They Harm: Evidence from Eight Cross-Domain Evaluations

    Sep 22, 2026Nithin Raghava Ramachandra NarlaFairness AuditsAlgorithmic Fairness

  5. ClashBench: Conflicts Leading Agents to Seize and Harm

    Sep 17, 2026Yuejin Xie, Yu Li, Dadi Guo +6Runtime Safety FilteringPreemption

  6. Safety Beyond the Interface: Detecting Harm via Latent States in Large Language Models

    Sep 16, 2026Alizishaan Khatri, Chiquita Prabhu, Omkar NeogiLarge Language Model SafetyGuardrail

  7. Characterizing Bluesky Content Moderation Service: From Automation of Service to Landscape of Harms

    Sep 12, 2026Pushpdeep Singh, Sayeh Jarollahi, Ayan Majumdar +5Content ModerationModel Auditing

  8. Signed Rescue Routing: Harm-Aware Cascades for Efficient LLM Inference

    Sep 7, 2026Zheyuan Wang, Siyu Li, Peiqiao Song +3Large Language Model RoutingLLM Inference Optimization

  9. HarmoCore: Functional Latent Diffusion for Sparse Reconstruction of Oscillatory Wave Fields

    Sep 1, 2026Lihao Chen, Xinyu Zhang, Panqi Chen +4Complex WavefieldSignal Reconstruction

  10. The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal

    Aug 31, 2026Md Mokarram Chowdhury, Ernie Chang, Yang LiJailbreaksJailbreak Attacks

  11. AI and Consumer Rights in India Working Paper

    Aug 13, 2026Omir Kumar, Sriya Sridhar, Vibhav Mithal +1Artificial Intelligence SystemsHindi

  12. HarMoE: Multi-Source Chest Radiograph Pretraining with Dataset-Disentangled Experts

    Aug 3, 2026Haozhe Luo, Ziyu Zhou, Shelley Zixin Shu +1Chest X-RayMedical Vision-Language Models

  13. (Im)Paired Programming: Coding Agents Improve Productivity but Harm Understanding

    Jul 29, 2026Nishant Balepur, Connor Baumler, Valerie Chen +3Coding AgentsArtificial Intelligence Agents

  14. Psychological Influences of Conversational AI: Research and Design Directions for Reducing Harm and Promoting Well-Being

    Jul 27, 2026Jina Suh, Mihaela Vorvoreanu, Forough Poursabzi-Sangdeh +5Well-BeingConversational Artificial Intelligence

  15. Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

    Jul 27, 2026Xinnuo Xu, Anja Thieme, Daniela Massiceti +6ToxicityAdversarial Prompts

  16. When Should Active RAG Retrieve? A Budget-Aware Evaluation of Utility, Calibration, and Cost

    Jul 27, 2026Pin Qian, Su Wang, Chong Peng +5Retrieval-Augmented Generation PipelinesToken Budget Allocation

  17. Sound Probabilistic Safety Bounds for Large Language Models

    Jul 22, 2026Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani +1Large Language Model SafetyProbabilistic Safety

  18. HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

    Jul 19, 2026Lingwei Dang, Juntong Li, Zonghan Li +5Hand-Object Interaction Detection3D Motion

  19. AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation

    Jul 13, 2026Yi Ting Shen, Kentaroh Toyoda, Alex LeungRed-TeamingAttack-Success Rate

  20. ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

    Jul 11, 2026Kefan Song, Yanjun QiAgentic DeploymentsMalicious Agents

  21. HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

    Jun 25, 2026Jiajun Wu, Haoyu Kang, Yining Sun +13Long-Video BenchmarksLarge Multimodal Models

  22. One Year Later...The Harms Persist, But So Do We!

    Jun 22, 2026Annika Marie Schoene, Cansu Canca, Gautham Vijay Kumar +1Mental HealthLarge Language Model Safety

  23. On Defining Erasure Harms for NLP

    Jun 14, 2026Yu Lu Liu, Arnav Goel, Jackie Chi Kit Cheung +3Concept ErasureHarms

  24. No-Harm Physics-Informed Inverse Learning with Residual-Calibrated Uncertainty

    Jun 5, 2026Ronald KatendeCalibrated UncertaintyReconstruction Error

  25. Investigating and Alleviating Harm Amplification in LLM Interactions

    Jun 1, 2026Ruohao Guo, Wei Xu, Alan RitterLarge Language Model SafetyHarms

  26. LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

    May 29, 2026Krishnapriya Vishnubhotla, Sowmya Vajjala, Akriti Vij +1Large Language Model JudgesJudges

  27. MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization

    May 28, 2026Anisha Saha, Varsha Suresh, Teodora Kamova +3Multimodal ReasoningCross-Modal

  28. Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills

    May 28, 2026Chia-Yi Hsu, Chia-Mu Yu, Chun-Ying Huang +1Malicious AgentsCoding Agents

  29. HarmoVid: Relightful Video Portrait Harmonization

    May 27, 2026Jun Myeong Choi, Jae Shin Yoon, Luchao Qi +2Video RestorationVideo Diffusion Models

  30. PAST2HARM: A Simple Adaptive Past Tense Attack for Jailbreaking Multimodal AI

    May 26, 2026Snehasis MukhopadhyayAdversarial PromptsHarms

  31. HARP: Measuring Harm Amplification in Multi-Agent LLM Systems

    May 26, 2026Md Hafizur Rahman, Zafaryab Haider, Tanzim Mahfuz +1Multi-Agent Large Language Model SystemsHarms

  32. First, do no harm: Breaking suicidogenic echo chambers in media recommendation

    May 24, 2026Alberto Díaz-Álvarez, Raúl Lara-Cabrera, Fernando Ortega-Requena +1Suicide RiskRecommendation

  33. Counterfactually Safe Reinforcement Learning

    May 24, 2026Jingyi Li, Peng Wu, Chengchun ShiCounterfactual LearningOptimality

  34. Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

    May 20, 2026Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat MasoodHallucination DetectionHarms

  35. HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models

    May 11, 2026Qiuxuan Feng, Jiale Yu, Jiaming Liu +8Efficient World-Action ModelWorld Models

  36. Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms

    May 8, 2026Linh Le, David Williams-King, Mohamed Amine Merzouk +2Adversarial TrainingHarms

  37. The Moltbook Files: A Harmless Slopocalypse or Humanity's Last Experiment

    May 8, 2026William Brach, Federico Torrielli, Stine Lyngsø Beltoft +3Large Language Model SafetyOpenclaw

  38. One Turn Too Late: Learning When to Intervene Against Multi-Turn Malicious Intent

    May 7, 2026Xinjie Shen, Rongzhe Wei, Peizhi Niu +6AttackerMalicious Agents

  39. HARMES: A Multi-Modal Dataset for Wearable Human Activity Recognition with Motion, Environmental Sensing and Sound

    May 4, 2026Robin Burchard, Pascal-André Brückner, Marius Bock +2Human Activity RecognitionMulti-Modal Sensing

  40. PrismAgent: Illuminating Harm in Memes via a Zero-Shot Interpretable Multi-Agent Framework

    May 1, 2026Zihan Ding, Ziyuan Yang, Yi ZhangMemesHate Speech Detection

  41. Representational Harms in LLM-Generated Narratives Against Global Majority Nationalities

    Apr 24, 2026Ilana Nguyen, Harini Suresh, Thema Monroe-White +1Large Language Model BiasNarratives

  42. When Safety Fails Before the Answer: Benchmarking Harmful Behavior Detection in Reasoning Chains

    Apr 21, 2026Ishita Kakkar, Enze Zhang, Rheeya Uppaal +1Reasoning TracesReasoning Chain

  43. Human-Guided Harm Recovery for Computer Use Agents

    Apr 20, 2026Christy Li, Sky CH-Wang, Andi Peng +1Computer-Use AgentsHarms

  44. Informing AI Policy Assessment using Large-Scale Simulation of Interventions

    Apr 20, 2026Julia Barnett, Kimon Kieslich, Natali Helberger +1Eu Artificial Intelligence ActArtificial Intelligence Governance

  45. Owner-Harm: A Missing Threat Model for AI Agent Safety

    Apr 20, 2026Dongcheng Zhang, Yiqing JiangHarms

  46. First, Do No Harm (With LLMs): Mitigating Racial Bias via Agentic Workflows

    Apr 20, 2026Sihao Xing, Zaur GoulievLarge Language Model BiasDiagnosis

  47. RoTRAG: Rule of Thumb Reasoning for Conversation Harm Detection with Retrieval-Augmented Generation

    Apr 19, 2026Juhyeon Lee, Wonduk Seo, Junseo Koh +3HarmsDialogue Benchmarks

  48. Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

    Apr 10, 2026Hadas Orgad, Boyi Wei, Kaden Zheng +4Large Language Model SafetyHarmful Content

  49. A Marketplace for AI-Generated Adult Content and Deepfakes

    Jan 14, 2026Shalmoli Ghosh, Matthew R. DeVerna, Filippo MenczerDeepfake DetectionHarms

  50. ECHO: A Participatory Framework for Bias-Anchored AI Harm Anticipation

    Nov 27, 2025Nicoleta Tantalaki, Sophia Vei, Athena VakaliEthicsHarms