Adversarial Robustness of Language Models

Latest papers 123

All topics
CardsList
  1. GPE: Evaluating Robust Evidence Aggregation for Fact Verification under Controllable GEO-Style Poisoning

    Jul 22, 2026Zhaoqi Wang, Zijian Zhang, Xiaomei Yuan +4RAG Poisoning AttacksAutomated Fact-Checking

  2. AIMO Interpretability Challenge

    Jul 15, 2026Michal Štefánik, Philipp Mondorf, Andreas Waldis +11Mathematical Reasoning BenchmarksLLM Interpretability

  3. Can We Trust LLM's Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-Based Framework

    Jul 9, 2026Riccardo Revalor, Jalees Rehman, Debjit PalCoT FaithfulnessLLM Reasoning with Graphs

  4. Efficient Safety Alignment of Language Models via Latent Personality Traits

    Jul 8, 2026Mohamed Amine Merzouk, Nolan Smyth, Damiano Fornasiere +3Adversarial TrainingLLM Safety Alignment

  5. Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs

    Jul 8, 2026Anupam Wagle, Ifrat Ikhtear Uddin, Chaowei Zhang +1LLM InterpretabilityAdversarial Attacks on LLMs

  6. RustMizan: A Compilable, Contamination-Aware Benchmarking Framework for Rust Vulnerabilities

    Jul 6, 2026Tarek Elsayed, Shiping Yang, Eunsong Koh +13Software Vulnerability DetectionData Contamination in Language Models

  7. HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

    Jul 2, 2026Navaneeth Sangameswaran, Preetham S, Ashmiya LeninLLM Safety BenchmarksLanguage Model Safety Evaluation

  8. HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment

    Jul 1, 2026Shei Pern Chua, Hao Wu, Qianli Ma +1Adversarial Attacks on LLMsLLM Safety Alignment

  9. IHDec: Divergence-Steered Contrastive Decoding for Securing Multi-Turn Instruction Hierarchies

    Jun 29, 2026Nicole Geumheon Liu, Haeun Jang, Yonghyun Jun +1Instruction FollowingPrompt Injection Defense

  10. Low-Agreeableness Persona Conditioning for Safe LLM Fine-Tuning

    Jun 26, 2026Austin MY Cheung, Yi YangLLM Fine-TuningLLM Safety Alignment

  11. Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models

    Jun 25, 2026Abrar Alotaibi, Moataz AhmedAdversarial Attacks on VLMsAdversarial Attacks

  12. At the Edge of Understanding: Sparse Autoencoders Trace The Limits of Transformer Generalization

    Jun 24, 2026Praneet Suresh, Jack Stanley, Sonia Joseph +2Distribution Shift RobustnessTransformer Interpretability

  13. Beyond Safe Data: Pretraining-Stage Alignment with Regular Safety Reflection

    Jun 17, 2026Jinhan Li, Kexian Tang, Yihan Xu +2Language Model PretrainingLLM Alignment

  14. A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models

    Jun 16, 2026Nicola FrancoLanguage Model Safety EvaluationNeural Network Robustness

  15. AnchorKV: Safety-Aware KV Cache Compression via Soft Penalty with a Refusal Anchor

    Jun 16, 2026Ning Ni, Yingjie LaoKV CachingLLM Safety Alignment

  16. Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs

    Jun 14, 2026Nafiseh Nikeghbal, Amir Hossein Kargaran, Shaghayegh Kolli +1LLM EvaluationLLM Reliability

  17. Measuring Epistemic Resilience of LLMs Under Misleading Medical Context

    Jun 10, 2026Hongjian Zhou, Xinyu Zou, Jinge Wu +19LLM ReliabilityMedical QA

  18. Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models

    Jun 9, 2026Malikeh Ehghaghi, Boglárka Ecsedi, Marsha Chechik +1LLM AlignmentNeural Network Robustness

  19. Small Data, Big Noise: Adversarial Training for Robust Parameter-Efficient Fine-Tuning

    Jun 9, 2026Eitan Cohen, Idan Simai, Uri ShahamAdversarial TrainingNeural Network Robustness

  20. Game-Theoretic Multi-Agent Control for Robust Contextual Reasoning in LLMs

    Jun 9, 2026Saeid Jamshidi, Amin Nikanjam, Arghavan Moradi Dakhel +2Adversarial Attacks on LLMsMulti-Agent Control

  21. Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

    Jun 8, 2026Blake Bullwinkel, Eugenia Kim, Amanda Minnich +1Adversarial TrainingAdversarial Attacks on LLMs

  22. Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks

    Jun 6, 2026Haoming Wen, Shi Chen, Qingyu Shi +4Adversarial TrainingLLM Alignment

  23. Adversarial Robustness of Activation Steering in Large Language Models

    Jun 5, 2026Kien Le, Thai LeLLM EvaluationLanguage Model Steering

  24. Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories

    Jun 3, 2026Kyungmin Park, Taesup KimAdversarial Attacks on LLMsLLM Safety Alignment

  25. Hybrid Adversarial Defence for Natural Language Understanding Tasks

    Jun 3, 2026Manar Abouzaid, Yang Wang, Chenghua Lin +1LLM Hallucination MitigationLLM Security