Language Model Robustness

Latest papers 338

All topics
CardsList
  1. A Robust Evaluation of Probe Robustness: Lessons for Reliable OOD Uncertainty Quantification

    Apr 13, 2026Joe Stacey, Hadas Orgad, Kentaro Inui +2LLM EvaluationUncertainty Quantification

  2. Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence

    Apr 9, 2026Niklas Herbster, Martin Zborowski, Alberto Tosato +2LLM Safety AlignmentLanguage Model Robustness

  3. DIA-HARM: Dialectal Disparities in Harmful Content Detection Across 50 English Dialects

    Apr 7, 2026Jason Lucas, Matt Murtagh, Ali Al-Lawati +3Fake News DetectionAutomated Fact-Checking

  4. Reasoning Shift: How Context Silently Shortens LLM Reasoning

    Apr 1, 2026Gleb Rodionov, Roman Garipov, George YakushevLanguage Model RobustnessLLM Context Management

  5. SeaAlert: Robust Severity Classification and LLM-Based Information Extraction for Noisy Maritime Distress Communications

    Mar 23, 2026Tomer Atia, Yehudit Aperstein, Alexander ApartsinLLM Information ExtractionLanguage Model Robustness

  6. Endogenous Resistance to Activation Steering in Language Models

    Feb 6, 2026Alex McKenzie, Keenan Pepper, Stijn Servaes +6Language Model SteeringLanguage Model Robustness

  7. SalamahBench: Dialect and Category Level Safety Evaluation of Arabic Language Models

    Feb 3, 2026Omar Abdelnasser, Fatemah Alharbi, Khaled Khasawneh +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  8. Robustness as an Emergent Property of Task Performance

    Feb 3, 2026Shir Ashury-Tahan, Ariel Gera, Elron Bandel +2Neural Network RobustnessLanguage Model Robustness

  9. MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation

    Jan 29, 2026Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro +6Numerical Reasoning in Language ModelsMathematical Reasoning Benchmarks

  10. ReportLogic: Evaluating Logical Quality in Deep Research Reports

    Jan 27, 2026Jujia Zhao, Zhaoxin Huan, Zihan Wang +4LLM-as-a-JudgeAutomated Evaluation

  11. The Effect of Scripts and Formats on LLM Numeracy

    Jan 21, 2026Varshini Reddy, Craig W. Schmidt, Seth Ebner +3Numerical Reasoning in Language ModelsMultilingual Language Model Evaluation

  12. ChartAttack: Testing the Vulnerability of LLMs to Malicious Prompting in Chart Generation

    Jan 19, 2026Jesus-German Ortiz-Barajas, Jonathan Tonglet, Vivek Gupta +1Data VisualizationAdversarial Attacks on VLMs

  13. Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models

    Jan 8, 2026Zheng Luo, T Pranav Kutralingam, Ogochukwu N Okoani +3Multilingual Language Model EvaluationLLM Tool Use

  14. Hidden State Poisoning Attacks against Mamba-based Language Models

    Jan 5, 2026Alexandre Le Mercier, Chris Develder, Thomas DemeesterAdversarial Attacks on LLMsLanguage Modeling

  15. MERGE: Minimal Expression-Replacement GEneralization Test for Natural Language Inference

    Oct 28, 2025Mădălina Zgreabăn, Tejaswini Deoskar, Lasha AbzianidzeLanguage Model RobustnessNatural Language Inference

  16. Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs

    Oct 16, 2025Parsa Hejabi, Elnaz Rahmati, Alireza S. Ziabari +1Unsupervised LearningLanguage Model Robustness

  17. VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents

    Oct 13, 2025Jiliang Hu, Wenfu Wang, Zuchao Li +6Audio-Language Model EvaluationVoice Agent Evaluation

  18. Black-Box Detection of LLM-Generated Text Using Generalized Jensen-Shannon Divergence

    Oct 8, 2025Shuangyi Chen, Ashish KhistiAI-Generated Text DetectionLanguage Model Robustness

  19. Are LLMs Reliable Rankers? Rank Manipulation via Two-Stage Token Optimization

    Oct 8, 2025Tiancheng Xing, Jerry Li, Yixuan Du +1Adversarial Attacks on LLMsLLM Reranking

  20. Robustness assessment of large audio language models in multiple-choice evaluation

    Oct 6, 2025Fernando López, Santosh Kesiraju, Jordi LuqueAudio-Language Model EvaluationAudio QA

  21. VietBinoculars: A Zero-Shot Approach for Detecting Vietnamese LLM-Generated Text

    Sep 30, 2025Trieu Hai Nguyen, Sivaswamy AkileshAI-Generated Text DetectionLanguage Model Robustness

  22. From Construction to Injection: Edit-Based Fingerprints for Large Language Models

    Sep 3, 2025Yue Li, Xin Yi, Dongsheng Shi +3Language Model FingerprintingLLM Security

  23. Data Security in Large Language Models: Risks, Defense, and Directions

    Aug 4, 2025Kang Chen, Xiuze Zhou, Yuanhui Yu +4Adversarial Attacks on LLMsLLM Security

  24. Measuring Intent Comprehension in LLMs

    Jun 19, 2025Nadav Kunievsky, James A. EvansPrompt SensitivityLLM Evaluation