Language Model Robustness

Latest papers 338

All topics
CardsList
  1. How Robust Are LLMs to Vietnamese Dialects?

    Aug 11, 2026Minh Tran, Trinh Chau, Thanh-Nhan Le +4LLM EvaluationLanguage Model Robustness

  2. Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness

    Aug 10, 2026Tadanobu Chuyo Kamijo, Ori Rottenstreich, Javier Conde +2LLM EvaluationLanguage Model Robustness

  3. Cultivar: A Contrastive and Locale-Oriented Translation Benchmark for Investigating Contamination and Localisation Robustness

    Aug 10, 2026Pinzhen Chen, Koel Dutta Chowdhury, Xiaoya Xu +20Data Contamination in Language ModelsLanguage Model Robustness

  4. Capability Is Not Propensity: Measuring Pressure-Robust Cooperative Behavior in Civic LLM Agents

    Aug 10, 2026Neel Tushar Shah, Manglam Kartik, Akshat KarkarLLM Agent EvaluationLanguage Model Robustness

  5. UNMASK: Discovering and Causally Verifying Spurious Shortcuts in Text Classifiers

    Aug 10, 2026Chidaksh Ravuru, Shashank SrivastavaClassificationSpurious Correlation Robustness

  6. Are LLMs Positionally Consistent Ordinal Classifiers? A Systematic Evaluation

    Aug 9, 2026Yu Wang, Zhe Zhou, Menglin Liu +1Language Model Bias EvaluationClassification

  7. Calling the Bluff: Detecting Ever-Shifting Harmful Chat Dialogue via Ordered Reasoning Chain Regularization

    Aug 9, 2026Haojie Yu, Ziyou Jiang, Junjie Wang +4Language Model Safety EvaluationText Classification

  8. On the Robustness of LLMs' Internal Representation of Code Correctness

    Aug 8, 2026Francisco Ribeiro, Sohaila Abdulsattar, Renata Gonzalez +2LLM ReliabilityLanguage Model Robustness

  9. STEMMA: An Adversarial Multi-Agent Framework for Evaluating Self-Identity Consistency in LLMs

    Aug 8, 2026Nuthakki Siva Gopala Krishna, Kanishka JainLanguage Model Robustness

  10. Counterfactual Benchmarking and Training for Factuality Consistency and Order-Robust Grounded Reasoning in LLMs over Heterogeneous Knowledge

    Aug 8, 2026Shibo Chu, Yuze Liu, Tiehua Zhang +4LLM EvaluationLLM Grounding

  11. Learning When to Trust via Selective Context Preference Optimization

    Aug 6, 2026Xian Sun, Wei Chow, Yingshuo Wang +4Knowledge Conflicts in Language ModelsLLM Reliability

  12. Different Perturbations, Different Mechanisms: Understanding Continued Pre-training for Zero-Shot Dialect Robustness

    Aug 6, 2026Aarohi Srivastava, David ChiangLanguage Model PretrainingMultilingual Language Models

  13. Evaluating Theory of Mind in Reasoning Models: Robustness over Reasoning

    Aug 5, 2026Ian B. de Haan, Peter van der Putten, Max van DuijnLLM EvaluationTheory of Mind

  14. Leak-Resistant Unlearning: A New Benchmark for Evaluating Multi-Hop Reasoning Consistency and Recovery Robustness

    Aug 5, 2026Haoting Qian, Qingjie Zhang, Zhicong Huang +2Multi-Hop ReasoningLanguage Model Robustness

  15. Should We Type or Talk to LLM Agents? A Comprehensive Study of Voice and Keyboard Input Perturbations

    Aug 4, 2026Zizhao Hu, Nathan Elijah Segura, Mohammad Rostami +1Language Model Robustness

  16. GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning

    Aug 3, 2026Zhaoxin Yu, Qi Shen, Hengli Li +4Test-Time OptimizationLLM Interpretability

  17. Training-Free versus Training-Based Intent Classification in LLMs: Accuracy, Robustness, and Failure Modes

    Aug 3, 2026Nan Chen, Zhouhao Yang, Soufiane HayouZero-Shot LearningLLM Evaluation

  18. SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling

    Aug 2, 2026Shrenil Shaun Sharma, Avi SharmaCombinatorial OptimizationLLM Reliability

  19. Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity

    Aug 1, 2026Yongxi Zhou, Junwei Yao, Yuanzhe Liu +4LLM Safety BenchmarksPrompt Sensitivity

  20. CDAE: Enhancing Perturbation Robustness in Pretrained Language Models with Contrastive Denoising

    Jul 30, 2026Sina Heydari, Amirreza Abbasi, Mohsen Hooshmand +1Contrastive LearningDenoising Autoencoders

  21. Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models

    Jul 29, 2026Parishruthi Ganesh, Gerry Dozier, Cheryl SealsLLM EvaluationZero-Shot Text Classification

  22. Hierarchical Group-Conditional Conformal Risk Control for Selective Prediction in Language Models

    Jul 27, 2026Murilo Salem, Luísa Böhm, Daniel Pontes +1Selective PredictionGroup-Conditional Conformal Prediction