Multilingual Language Model Evaluation

Latest papers 309

All topics
CardsList
  1. CultureTalk-ID: A Multi-Task Dialogue Benchmark for Cultural Commonsense in Indonesian Local Languages

    Jul 23, 2026Muhammad Dehan Al Kautsar, Salsabila Pranida, Bilal Elbouardi +1Multilingual Language Model EvaluationMulti-Turn Dialogue Evaluation

  2. From a Word-Level Dictionary to Sentence-Level Semantics: Multilingual Grievance Labelling with Contextual Models

    Jul 23, 2026Lin Tian, Marian-Andrei RizoiuMultilingual Language Model EvaluationText Classification

  3. LKValues: Aligning Large Language Models with Sri Lankan Societal Values

    Jul 22, 2026Nethmi Muthugala, Supryadi, Surangika Ranathunga +7Multilingual Language Model EvaluationLLM Alignment

  4. Overview of FinMMEval 2026 Task 2: Multilingual Financial Short-Answer Question Answering

    Jul 22, 2026Zhuohan Xie, Xueqing Peng, Georgi Georgiev +18Multilingual Language Model EvaluationFinancial QA

  5. Overview of FinMMEval 2026 Task 1: Multilingual Financial Multiple-Choice Question Answering

    Jul 22, 2026Zhuohan Xie, Yuyang Dai, Rania Elbadry +18Multilingual Language Model EvaluationMultiple-Choice Question Answering

  6. MIRA-Ev:A Benchmark for Granular Evidence Detection and Relational Reasoning in Clinical Exams

    Jul 21, 2026Iker De la Iglesia, Johanna Ramirez-Romero, Jose Maria Villa-Gonzalez +3Multilingual Language Model EvaluationArgument Mining

  7. Building a European Multilingual Evaluation Dataset: The MMLU Localisation Project within the EMT Network

    Jul 20, 2026Pilar Sánchez-Gijón, Susana Valdez, Sofía Calvo Del Barrio +3Multilingual Language Model Evaluation

  8. Enabling Multilingual Privacy Policy Audits: Large-Scale Analysis of Spanish Mobile Apps

    Jul 20, 2026Marcos Moran, David Rodriguez, Luka Nenadic +2Privacy AuditingMultilingual Language Model Evaluation

  9. KyrgyzLLM-Bench: Benchmarking Kyrgyz Language Understanding

    Jul 19, 2026Timur Turatali, Aida Turdubaeva, Rustem Izmailov +2Multilingual Language Model EvaluationLLM Reliability

  10. Similarity All The Way Up: Multilingual Generalization in LLMs Relies on Language-Level Similarity Structures

    Jul 18, 2026Supantho Rakshit, Adele Goldberg, Henry ConklinMultilingual Language Model EvaluationCross-Lingual Reasoning in Language Models

  11. Conditional Reliability of Toxicity Signals for Multilingual and Code-Mixed Abuse Detection

    Jul 17, 2026Indraveni Chebolu, Rohan Singh, Arnab Mallick +1Multilingual Language Model EvaluationHate Speech Detection

  12. Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

    Jul 16, 2026Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez +5Multilingual Language Model EvaluationCode Generation

  13. LLM Evaluators are Biased across Languages

    Jul 16, 2026Ej Zhou, Lucas Resck, Zheng Hui +1Multilingual Language Model EvaluationLanguage Model Safety Evaluation

  14. High-Order Question Generation in a Multilingual Educational Context

    Jul 15, 2026Suna-Şeyma Uçar, Itziar Aldabe, Nora Aranberri +1Multilingual Language Model EvaluationLLM Prompting

  15. The Test Oracle Problem in Synthetic LLM-as-Judge Corpora: Disappearance, Distortion and a Validation Protocol

    Jul 15, 2026Serkan BallıMultilingual Language Model EvaluationLLM-as-a-Judge

  16. Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers

    Jul 14, 2026Dmitrij ŻatuchinMultilingual Language Model EvaluationLLM Reliability

  17. GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models

    Jul 14, 2026Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim +2Mathematical Reasoning BenchmarksMultilingual Language Model Evaluation

  18. MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning

    Jul 13, 2026Ayoung Lee, Ryan Kwon, Yunxiang Zhang +3Multilingual Language Model EvaluationMoral Reasoning in Language Models