Adversarial Robustness of Language Models

Latest papers 123

All topics
CardsList
  1. Counting Moves, Weighing Voices: Bayesian Dialectical Argumentation for Calibrated Multi-LLM Councils under Persistent Adversaries

    Oct 1, 2026Ionel Eduard Stan, Paolo NapoletanoLanguage Model CalibrationComputational Argumentation

  2. DeBERTa-ConPara: Attack-Aware and Deployment-Realistic Detection of AI-Generated Text

    Oct 1, 2026Mohamed Mady, Yupei Li, Johannes Reschke +1AI-Generated Text DetectionAdversarial Robustness of Language Models

  3. Towards Robust Numerical Claim Verification

    Sep 30, 2026Peter Røysland Aarnes, Vinay SettyNumerical Reasoning in Language ModelsClaim Verification

  4. ACTR: Aligning Thoughts and Responses for Multilingual Safety in Reasoning LLMs

    Sep 29, 2026Xianhui Zhang, Jian Yu, Chengyu Xie +6Adversarial Attacks on LLMsLLM Safety Alignment

  5. Safer Content or Firmer Refusals? A Hybrid Perturbation Defense for Alignment under Harmful Fine-tuning

    Sep 29, 2026Muhammad Zeeshan Akram, Mufid Kamel Marican, Anvesh Reddy Yenugu +2LLM Safety AlignmentAdversarial Robustness of Language Models

  6. DeShortcut-Align: Decoupling Spurious Shortcuts for Robust Safety Alignment in Large Reasoning Models

    Sep 28, 2026Qirui Liu, Yichen Sun, Yan Wang +4LLM Safety AlignmentAdversarial Robustness of Language Models

  7. On the Efficiency-Safety Dilemma in Large Reasoning Models

    Sep 20, 2026Yifei Yang, Zouying Cao, Xingrui Wang +4LLM Inference AccelerationLLM Jailbreak Attacks

  8. Contagion on the Trading Floor: How Adversarial Signals Spread in Multi-Agent Trading Systems

    Sep 17, 2026Qi Rong Sua, Junhao Dong, Nguyen Duc Thai +3Multi-Agent LLM SystemsAdversarial Robustness of Language Models

  9. Market Signal Injection: Adversarial Context Manipulation of LLM Pricing Agents

    Sep 16, 2026Dohun Lee, Hyunwoo ParkAdversarial Attacks on LLMsAI Agent Security

  10. Active Adaptation, Not Static Defense: Temporal Dynamics of Preventative Steering in Adversarial Fine-Tuning

    Sep 9, 2026Jing Guan, Yachao Yang, Zhaoliang Liu +3LLM Fine-TuningAdversarial Attacks on LLMs

  11. Style Over Substance: Content-Invariant Wrappers Flip LLM Safety-Judge Verdicts

    Sep 8, 2026Yongxi Zhou, Wenbo Ye, Yuanzhe Liu +2LLM Safety BenchmarksLLM-as-a-Judge

  12. Representational alignment yields generalizable safety in language models

    Sep 3, 2026Lingyu Li, Yan Teng, Yingchun Wang +1Moral Reasoning in Language ModelsLLM Safety Alignment

  13. Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs

    Aug 12, 2026Nimet Beyza Bozdag, Emre Can Acikgoz, Gokhan Tur +1Deception in Language ModelsAdversarial Attacks on LLMs

  14. Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs

    Aug 10, 2026Hongli Shen, Shaopeng Fu, Qinbo Zhang +2Adversarial TrainingAdversarial Attacks on LLMs

  15. Build it, Break it, Repeat: Benchmarking and improving LLM-manipulated disinformation detection in social media posts

    Aug 10, 2026Kevin Thomas, Milosz Kasprzyk, Reuel C Igbokwe Onuigbo +5AI-Generated Text DetectionAdversarial Robustness of Language Models

  16. Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment

    Aug 5, 2026Alina Klerings, Jannik Brinkmann, Heiner Stuckenschmidt +1Adversarial Attacks on LLMsLLM Safety Alignment

  17. Sharding Prevents LLM Oversight Failures and Adversarial Exploitation

    Aug 5, 2026Victor Akinwande, J. Zico Kolter, Aran NayebiScalable OversightLLM Evaluation

  18. Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks

    Aug 4, 2026Atri Vivek Sharma, Brian Formento, Alessio LomuscioRetrieval-Augmented GenerationAdversarial Attacks

  19. Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks

    Aug 2, 2026Shangze Li, Chuancheng Shi, Simiao Xie +6Adversarial Attacks on LLMsLLM Safety Alignment

  20. On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

    Jul 29, 2026Yongjian Guo, Wanlun Ma, Lingyu Shen +2LLM Safety AlignmentAdversarial Robustness of Language Models

  21. Evaluation of Adversarial Robustness in Arabic Language Models

    Jul 28, 2026Anwar Alajmi, Ayed Salman, Imtiaz AhmadAdversarial TrainingArabic NLP

  22. Distribution-Specific Curvature Control with Finite-Sample Guarantees for Open-Weight Safety

    Jul 24, 2026Domenic Rosati, Ali Dadsetan, Hong Huang +5Adversarial RobustnessLLM Safety Alignment

  23. Trustworthiness Costs of Domain Adaptation in Small Language Models:A Cross-Architecture Empirical Study

    Jul 23, 2026Ramesh B. ParamkushamLanguage Model Safety EvaluationDomain Adaptation