Language Model Robustness

Latest papers 338

All topics
CardsList
  1. Dialect-Robust Speech Language Models with Synthetic Pseudo-Dialect Augmentation

    Oct 7, 2026Shunsuke Mitsumori, Tomoya Mizumoto, Yusuke FujitaSpeech Language ModelsLanguage Model Robustness

  2. Conditional Accuracy Profiles: Diagnosing LLM Judges across Deployment Conditions

    Oct 6, 2026Wenqi Li, Bin Liu, Mindi Ruan +3LLM EvaluationLLM-as-a-Judge

  3. The Dichotomy Between Pattern Recognition and Step-by-Step Reasoning

    Oct 6, 2026Amrut Nadgir, Pratik Chaudhari, Vijay BalasubramanianLLM ReasoningEfficient Language Model Reasoning

  4. A Systematic Study of Small Language Models on Abstract Reasoning Tasks

    Oct 6, 2026Nur A Zarin Nishat, Jens Lehmann, Andrei Aioanei +1OOD GeneralizationLanguage Model Robustness

  5. Large language models are vulnerable to incidental information in clinical documentation and reasoning

    Oct 6, 2026Krithik Vishwanath, Brandon Ye, Anton Alyakin +4Medical Report GenerationClinical Language Model Evaluation

  6. The Hidden States Cookbook: A Large-Scale Ablation Study for Noise-Robust Conversational Intent Classification in Industry

    Oct 4, 2026Bogdan Bogachov, Nikita Letov, Yaoyao Fiona ZhaoIntent ClassificationLanguage Model Robustness

  7. When Verifiable Counts Depend on Wording: Auditing Wording Robustness in Instruction Following

    Oct 4, 2026Qishi Zhan, Seoyeon Jang, Zihan Dong +3LLM EvaluationInstruction Following

  8. Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs

    Oct 1, 2026Nagham Omar, Mahmoud Jabarin, Maya Rozenshtein +3Prompt SensitivityLLM Evaluation

  9. Evaluating the Robustness of Japanese LLMs to IME-Related and Typographical Errors

    Oct 1, 2026Ryota Mibayashi, Hiroaki OhshimaLLM EvaluationLanguage Modeling

  10. Sense and Sensitivity: Benchmarking LLM Clinical Triage Recommendations with Physician Experts

    Sep 29, 2026Abinitha Gourabathina, Haoran Zhang, Yuexing Hao +2Clinical TriageClinical Decision-Making

  11. TALK-Dem: Benchmarking Embodied Task Planning under Dementia-Associated Communication Patterns

    Sep 29, 2026Guangxin Zhao, Yiran Hu, Yuan Cao +7Large Language Model-Based Robot PlanningRobot Task Planning

  12. Tool Mediation Alters Refusal Mechanisms in Large Language Models

    Sep 28, 2026Abel Rodríguez, Giuseppe Garofalo, Lieven Desmet +1Language Model Safety EvaluationLLM Agent Safety

  13. Decoupling Token Roles in Autoregressive Pretraining

    Sep 27, 2026Suqin Yuan, Runqi Lin, Kevin Qinghong Lin +4Language Model PretrainingAutoregressive Language Modeling

  14. JevOut: Natural Context Can Flip Decision Models

    Sep 24, 2026Zixiang Xu, Zirui Song, Chiyu Zhang +4Adversarial Attacks on LLMsLLM Decision-Making

  15. ENDOPROMPT: Victim-Side Pseudo-References for Utility Degradation

    Sep 24, 2026Qingyu Wu, Zeyu Feng, Yongda Yu +2Adversarial Prompt GenerationPrompt Injection Attacks

  16. Robust Detection of LLM-Generated Text under Contamination

    Sep 24, 2026Jiaxun Li, Saptarshi Chakraborty, Ambuj TewariAI-Generated Text DetectionLanguage Model Robustness

  17. Evaluation of pre-trained models for pedagogical assessment of novel AI-assisted educational questions

    Sep 23, 2026Michael Lawrence Castanares, Princess Ventures, Allan TanEducational AssessmentOOD Generalization

  18. Same Scores, Different Decisions: Evaluating JEV and Language Models for Legal Document Understanding

    Sep 23, 2026Fan Zhang, Yankai Chen, Zhuohan Xie +11LLM EvaluationEfficient Language Model Inference

  19. When Context Misleads: In-context Learning with Jurisdiction in Large Language Models

    Sep 23, 2026Pei-lin Li, Qingle Liu, Junyang Feng +4LLM EvaluationIn-Context Learning

  20. Universal Fractal Natural Language Decision Map: Real-Time Edge Triage Across Heterogeneous Domains

    Sep 21, 2026Volkan Dağlı, Zerrin Dağlı, Dağhan DağlıOn-Device Language Model InferenceEfficient Language Model Inference

  21. HerHealthEval: Evaluating Multilingual and Register-Sensitive Understanding of Women's Health Communication

    Sep 17, 2026Hassan Saeed Hassan Albattra, Mazen Mohammed Bahgat, Rahatara Ferdousi +2Multilingual Language Model EvaluationHealthcare

  22. AUDITPLAN: Commit, Then Answer for Auditable Safety Alignment

    Sep 16, 2026Sai Sri Pushpa Jampani, Kshitij Mishra, Asif EkbalLLM AlignmentLLM Auditing

  23. Can LLMs Follow the Pulse of a Crisis? Evaluating Crisis Sentiment in Bangladesh's July Uprising

    Sep 15, 2026Md. Samiul Alim, Mahir Shahriar Tamim, Tanvir Ahmed Khan +4LLM EvaluationSentiment Analysis