Adversarial Text Attacks

Latest papers 49

All topics
CardsList
  1. When Efficiency Backfires: Cascading LLMs Trigger Cascade Failure under Adversarial Attack

    May 17, 2026Zehan Sun, Dingfan Chen, Songze LiAdversarial Attacks on LLMsLLM Security

  2. Vaporizer: Breaking Watermarking Schemes for Large Language Model Outputs

    May 8, 2026Jonathan Hong Jin Ng, Anh Tu Ngo, Anupam ChattopadhyayWatermark RemovalLLM Watermarking

  3. Algospeak, Hiding in the Open: The Trade-off Between Legible Meaning and Detection Avoidance

    May 7, 2026Jan Fillies, Ronald E. Robertson, Jeffrey HancockLanguage Model Safety EvaluationAdversarial Text Attacks

  4. Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs

    May 7, 2026Md Farhamdur Reza, Richeng Jin, Tianfu Wu +1Multimodal Large Language ModelsJailbreak Attacks

  5. Chainwash: Multi-Step Rewriting Attacks on Diffusion Language Model Watermarks

    May 6, 2026Mohd Ruhul Ameen, Akif Islam, Nadim Mahmud +1Diffusion Model WatermarkingWatermark Removal

  6. Beating the Style Detector: Three Hours of Agentic Research on the AI-Text Arms Race

    May 4, 2026Andreas Maier, Moritz Zaiss, Siming BayerAI-Generated Text DetectionLanguage Model Generation Evaluation

  7. Fight Poison with Poison: Enhancing Robustness in Few-shot Machine-Generated Text Detection with Adversarial Training

    May 4, 2026Wenjing Duan, Qi Zhou, Yuanfan LiAdversarial TrainingAI-Generated Text Detection

  8. Led to Mislead: Adversarial Content Injection for Attacks on Neural Ranking Models

    May 2, 2026Amin Bigdeli, Amir Khosrojerdi, Radin Hamidi Rad +3Learning to RankAdversarial Attacks

  9. Emotion-Aware Clickbait Attack in Social Media

    Apr 30, 2026Syed Mhamudul Hasan, Mohd. Farhan Israk Soumik, Abdur R. ShahidSocial Media AnalysisAdversarial Text Attacks

  10. Agentic Adversarial Rewriting Exposes Architectural Vulnerabilities in Black-Box NLP Pipelines

    Apr 26, 2026Mazal Bethany, Kim-Kwang Raymond Choo, Nishant Vishwamitra +1Fake News DetectionAdversarial Prompt Generation

  11. Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety

    Apr 20, 2026Marcello Galisai, Susanna Cifani, Francesco Giarrusso +5LLM Safety BenchmarksAdversarial Attacks on LLMs

  12. Hijacking Text Heritage: Hiding the Human Signature through Homoglyphic Substitution

    Apr 11, 2026Robert DilworthStylometryAuthorship Attribution

  13. destroR: A Benchmark and Adversarial-Training Defense for Bangla Transfer Models under Meaning-Preserving Attacks

    Nov 13, 2025Saadat Rafid Ahmed, Rubayet Shareen, Radoan Sharkar +3Adversarial TrainingSentiment Analysis

  14. TSCheater: Generating High-Quality Tibetan Adversarial Texts via Visual Similarity

    Dec 3, 2024Xi Cao, Quzong Gesang, Yuan Sun +2Adversarial Robustness of Language ModelsAdversarial Text Attacks

  15. Perturbation Effects on Robustness and Individual Fairness

    Apr 1, 2024Xuran Li, Hao Xue, Peng Wu +4Neural Network RobustnessAlgorithmic Fairness