Multilingual Language Model Evaluation

Latest papers 309

All topics
CardsList
  1. RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering

    Apr 22, 2026Marisa Hudspeth, Patrick J. Burns, Brendan O'ConnorMultilingual Language Model EvaluationMultilingual QA

  2. Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMs

    Apr 21, 2026Guy Mor-Lan, Omer Goldman, Matan Eyal +6Multilingual Language ModelsMultilingual Language Model Evaluation

  3. CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks

    Apr 21, 2026Peiqin Lin, Chenyang Lyu, Wenjiang Luo +22Multilingual Language Model EvaluationLLM Evaluation

  4. MORPHOGEN: A Multilingual Benchmark for Evaluating Gender-Aware Morphological Generation

    Apr 20, 2026Mehul Agarwal, Aditya Aggarwal, Arnav Goel +2Multilingual Language Model EvaluationText Generation

  5. MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval

    Apr 20, 2026Shaden Alshammari, Kevin Wen, Abrar Zainal +5Mathematical Reasoning BenchmarksMultilingual Language Model Evaluation

  6. Do LLMs Use Cultural Knowledge Without Being Told? A Multilingual Evaluation of Implicit Pragmatic Adaptation

    Apr 20, 2026Mehwish Nasim, Sanjeevan Selvaganapathy, Neel Ganapathi Sabhahit +6Multilingual Language ModelsMultilingual Language Model Evaluation

  7. BIASEDTALES-ML: A Multilingual Dataset for Analyzing Narrative Attribute Distributions in LLM-Generated Stories

    Apr 18, 2026Yuxuan Ouyang, yingfeng luo, JingBo Zhu +1Multilingual Language Model EvaluationSocial Bias in Language Models

  8. No One Fits All: From Fixed Prompting to Learned Routing in Multilingual LLMs

    Apr 18, 2026Wei-Chi Wu, Sheng-Lun Wei, Hen-Hsen Huang +1Multilingual Language Model EvaluationLLM Prompting

  9. No Universal Courtesy: A Cross-Linguistic, Multi-Model Study of Politeness Effects on LLMs Using the PLUM Corpus

    Apr 17, 2026Hitesh Mehta, Arjit Saxena, Garima Chhikara +1Multilingual Language Model EvaluationLLM Evaluation

  10. Optimizing Korean-Centric LLMs via Token Pruning

    Apr 17, 2026Hoyeol Kim, Hyeonwoo KimMultilingual Language Model EvaluationLLM Pruning

  11. Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation

    Apr 13, 2026Lester James V. Miranda, Ivan Vulić, Anna KorhonenSupervised Fine-TuningMultilingual Language Models

  12. Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation

    Apr 6, 2026Alhasan Mahmood, Samir Abdaljalil, Hasan KurbanMultilingual Language Model EvaluationLLM-as-a-Judge

  13. SalamahBench: Dialect and Category Level Safety Evaluation of Arabic Language Models

    Feb 3, 2026Omar Abdelnasser, Fatemah Alharbi, Khaled Khasawneh +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  14. MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation

    Jan 29, 2026Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro +6Numerical Reasoning in Language ModelsMathematical Reasoning Benchmarks

  15. The Effect of Scripts and Formats on LLM Numeracy

    Jan 21, 2026Varshini Reddy, Craig W. Schmidt, Seth Ebner +3Numerical Reasoning in Language ModelsMultilingual Language Model Evaluation

  16. Preserving Fairness and Safety in Quantized LLMs Through Critical Weight Protection

    Jan 17, 2026Muhammad Alif Al Hakim, Alfan Farizki Wicaksono, Fajri KotoLLM QuantizationMultilingual Language Model Evaluation

  17. Untangling Input Language from Reasoning Language: A Diagnostic Framework for Cross-Lingual Moral Alignment in LLMs

    Jan 15, 2026Nan Li, Bo Kang, Tijl De BieMultilingual Language Model EvaluationLLM Alignment

  18. BizFinBench.v2: Towards Reliable LLMs in Finance via Real-User Data and Offline/Online Bilingual Evaluation

    Jan 10, 2026Xin Guo, Rongjunchen Zhang, Guilong Lu +4Financial ServicesMultilingual Language Model Evaluation

  19. Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models

    Jan 8, 2026Zheng Luo, T Pranav Kutralingam, Ogochukwu N Okoani +3Multilingual Language Model EvaluationLLM Tool Use

  20. MultiZebraLogic: A Multilingual Logical Reasoning Benchmark

    Nov 5, 2025Sofie Helene Bruun, Dan Saattrup SmartLogical ReasoningMultilingual Language Model Evaluation

  21. MedRECT: A Bilingual Medical Reasoning Benchmark for Error Correction in Clinical Texts

    Nov 1, 2025Naoto Iwase, Hiroki Okuyama, Junichiro IwasawaMultilingual Language Model EvaluationHealthcare

  22. Zoom In Disparities in Healthcare LLM Q&A

    Oct 20, 2025Ipek Baris Schlicht, Burcu Sayin, Zhixue Zhao +5Multilingual Language Model EvaluationKnowledge Augmentation for Language Models