Language Model Robustness

Latest papers 338

All topics
CardsList
  1. Improving Cross-Format Robustness in Language Models with Multi-Format Training

    Jun 10, 2026June M. Liu, Shaomian Zheng, He Cao +3Language Model RobustnessLLM Training

  2. Are We Evaluating Knowledge or Phrasing? Mitigating MCQA Sensitivity with ParaEval

    Jun 9, 2026João Maria Janeiro, Mathurin Videau, Andrea Caciolai +3LLM EvaluationMultiple-Choice Question Answering

  3. Decoupling Thought from Speech: Knowledge-Grounded Counterfactual Reasoning for Resilient Multi-Agent Argumentation

    Jun 9, 2026Jakub Masłowski, Jarosław A. ChudziakMulti-Agent DebateComputational Argumentation

  4. Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges

    Jun 8, 2026Yongtaek Lim, Hyeji Choi, Minwoo KimLLM-as-a-JudgeLLM Safety Evaluation

  5. Friend or Foe? Language as an ideological switch in open-weight LLMs under Russian disinformation stress

    Jun 7, 2026Anna Małgorzata Kamińska, Tetiana KlyninaMultilingual Language Model EvaluationPolitical Bias in Language Models

  6. When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

    Jun 6, 2026Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang +1Language Model Safety EvaluationLLM Auditing

  7. Arabic Sentence Segmentation Across Genres and Punctuation Conditions

    Jun 6, 2026Mohammed Elkholy, Khalid N. Elmadani, Nizar Habash +1LLM EvaluationArabic NLP

  8. Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy

    Jun 6, 2026Yuan Shen, Xiaojun Wu, Linghua YuLLM EvaluationLanguage Model Safety Evaluation

  9. SLMJury: Can Small Language Models Judge as Well as Large Ones?

    Jun 5, 2026Anish Laddha, Nitesh Pradhan, Gaurav SrivastavaLLM-as-a-JudgeLanguage Model Generation Evaluation

  10. Evaluating RAG Reliability under Clean, Misleading, and Mixed Retrieval

    Jun 5, 2026Sevgi Yigit-SertRetrieval-Augmented GenerationKnowledge Conflicts in Language Models

  11. When Better Codebooks Are Not Enough: Predictive Performance and Behavioral Reliability in LLM Political Event Coding

    Jun 4, 2026Zixian He, Bharath Raahul Murugesan, Patrick Brandt +1LLM EvaluationLLM-Assisted Annotation

  12. Revising Context, Shifting Simulated Stance: Auditing LLM-Based Stance Simulation in Online Discussions

    Jun 4, 2026Xinnong Zhang, Wanting Shan, Hanjia Lyu +2Counterfactual EvaluationLLM Auditing

  13. Decomposing Factual Sycophancy in Language Models: How Size and Instruction Tuning Shape Robustness

    Jun 4, 2026Victor De Marez, Luna De Bruyne, Walter DaelemansLLM EvaluationLLM Sycophancy

  14. Consistency Training Along the Transformer Stack

    Jun 4, 2026Sukrati Gautam, Neil Shah, Arav Dhoot +7Adversarial Attacks on LLMsLLM Safety Alignment

  15. A Systematic Analysis of Linguistic Features in AI-Generated Text Detection Across Domains and Models

    Jun 2, 2026Yassir El Attar, Esra Dönmez, Maximilian Maurer +1AI-Generated Text DetectionStylometry

  16. Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks

    Jun 2, 2026Malia Barker, Bishal Lakha, Edoardo Serra +1Numerical Reasoning in Language ModelsMathematical Reasoning Benchmarks

  17. Greener Than Humans? Environmental Attitudes in Large Language Models

    Jun 1, 2026Stefanie Kunkel, Tilman Hartwig, Marcus Voss +2LLM EvaluationLanguage Model Robustness

  18. Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference

    Jun 1, 2026Yafan Huang, Sheng Di, Guanpeng LiLLM InferenceLanguage Model Robustness

  19. Consistency Training while Mitigating Obfuscation via Rate Matching

    Jun 1, 2026Sohaib Imran, Prakhar Gupta, Jannes Elstner +1LLM SycophancyLanguage Model Robustness

  20. CARTE: A Benchmark for Mapping Language Model Knowledge Across France

    Jun 1, 2026Sarah Almeida Carneiro, Christos Xypolopoulos, Xiao Fei +2LLM EvaluationFactual Knowledge in Language Models

  21. Robust Reasoning via Dynamic Token Selection for Distribution-Aligned Self-Distillation

    May 30, 2026Ruiqi Zhang, Lingxiang Wang, Hainan Zhang Zhiming ZhengLanguage Model DistillationLanguage Model Robustness

  22. On the Limits of LLM Adaptability: Impact of Model-Internalized Priors on Annotation Task Performance

    May 30, 2026Etienne Casanova, Rafal Kocielnik, R. Michael AlvarezLLM EvaluationZero-Shot Text Classification

  23. Short-form Text Rewriting with Phi Silica

    May 30, 2026Divya Tadimeti, Shawn Pan, Sameera Lanka +2LLM Fine-TuningSmall Language Models

  24. EST-PRM: Stress-Testing Process Reward Models Before They Become Load-Bearing

    May 30, 2026Ibne Farabi Shihab, Fariya Afrin, Sanjeda Akter +1Process Reward ModelsLanguage Model Calibration

  25. On the Robustness of Multilingual Text Embedding Rankings Across Learning Tasks, Languages, and Benchmark Datasets

    May 29, 2026Ana Gjorgjevikj, Barbara Koroušić Seljak, Tome EftimovMultilingual Language Model EvaluationText Embedding Evaluation