Multilingual Language Model Evaluation

Latest papers 309

All topics
CardsList
  1. Target-Language Generation in Multilingual Models: Activation Steering and Optimal Control

    Sep 15, 2026James A. Michaelov, Carmen Amo Alonso, Tyler A. Chang +1Multilingual Language ModelsMultilingual Language Model Evaluation

  2. Turkish MMLU Pro: Traceable Option Augmentation and Its Validity Limits in Turkish Multiple-Choice Evaluation

    Sep 14, 2026M. Ali BayramMultilingual Language Model EvaluationLLM Evaluation

  3. Translating the Translator: Decomposing the Cost of English-Forced Inter-Agent Communication

    Sep 14, 2026Kushagra Agrawal, Yuming Feng, Man-Fai LeungMultilingual Language ModelsMultilingual Language Model Evaluation

  4. Multilingual in Name Only? Cultural and Linguistic Weaknesses of LLMs in Urdu

    Sep 12, 2026Farah Adeeba, Abdul Rafae Khan, Rajesh Bhatt +1Multilingual Language Model EvaluationCultural Knowledge in Language Models

  5. E-CONAN (Entailment, CONtradition And Neutral) Benchmarks: Arabic Textual Entailment and Natural Inference Datasets

    Sep 12, 2026Khloud AL Jallad, Nada Ghneim, Ghaida RebdawiMultilingual Language Model EvaluationArabic NLP

  6. The Eloquence submission for Task 2 of the Interspeech 2026 MLC-SLM challenge

    Sep 11, 2026Jordi Luque, Lorenzo Concina, Marco Matassoni +2Multilingual Language Model EvaluationMultilingual QA

  7. YallaMorph: A Benchmark for Evaluating Arabic Morphological Generation in Large Language Models

    Sep 9, 2026Mahmoud Reda, Salam Khalifa, Reham Marzouk +1Multilingual Language Model EvaluationArabic NLP

  8. 5-Dialects-BN: Unmasking the Impact of Transliteration on Bangla Dialectal LLMs

    Sep 9, 2026Md Mahir Jawad, Galib Mahmud Jim, Rafid Ahmed +3Multilingual Language Model EvaluationLow-Resource Language Processing

  9. SWORD: Wikidata-based Distortions Reveal Hidden Cross-Lingual Inconsistencies in LLM Factual Error Rejection

    Sep 8, 2026Sanghyeok Park, Minji Kang, Hosung Kwak +1Multilingual Language Model EvaluationFactual Knowledge in Language Models

  10. Navigating the digital spectrum: Assessing political bias, stability, and downstream fairness in Large Language Models

    Sep 8, 2026Luka Debevc, Nishan Chatterjee, Antoine Doucet +2Multilingual Language Model EvaluationPolitical Bias in Language Models

  11. Same Values, Different Languages? From Multilingual Probing to Steering LLMs Toward Chinese Social Values

    Sep 8, 2026Yuemei Xu, Kexin Xu, Jian Zhou +3Multilingual Language Model EvaluationCultural Alignment

  12. A Systematic Evaluation of Cross-Lingual Consistency Enhancement Methods in Multilingual Language Models

    Sep 3, 2026Jirui Qi, Mingyang Wang, Hinrich Schütze +2Multilingual Language Model EvaluationMultilingual QA

  13. IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks

    Sep 3, 2026Saikat Mondal, Mamta, Deeksha Varshney +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  14. Lost in Reordering: Structural Sensitivity of Multilingual LLMs under Semantics-Preserving Perturbations

    Sep 3, 2026Karthika Nhayakkat, Rajat Verma, Maharaj Brahma +4Numerical Reasoning in Language ModelsMultilingual Language Model Evaluation

  15. FrameBench:A Language Understanding Benchmark Based on Frame Semantics

    Sep 3, 2026Chihiro Yano, Ryohei SasanoMultilingual Language Model EvaluationLLM Evaluation

  16. TalkFa: A Unified Benchmark for Farsi Dialogue Generation and Understanding

    Sep 1, 2026Neda Jamshidi, Kamyar Zeinalipour, Fahimeh Akbari +3Multilingual Language Model EvaluationMulti-Turn Dialogue Evaluation

  17. VakyArth: Evaluating Pragmatic Competence in LLMs across Indic Languages

    Sep 1, 2026Usneek Singh, Poorvaja Veera Balaji Kumar, Parth Nanda +4Multilingual Language Model EvaluationLLM Evaluation

  18. Probing Factual Knowledge Transfer with Training Data Interventions

    Sep 1, 2026Romina Oji, Marc Braun, Marcel Bollmann +2Language Model PretrainingMultilingual Language Model Evaluation

  19. Latent Mechanisms of Language Control in Multilingual Language Models

    Aug 31, 2026Ryo Mitsuhashi, Sabri Boughorbel, Majd HawaslyMultilingual Language ModelsMultilingual Language Model Evaluation

  20. Assessing Suicide Risk in Arabic Crisis Helpline Calls: A Comparison of Arabic and English Large Language Models

    Aug 31, 2026Linhai Ma, Rita El Hachem, Mahatab El Hajj +2Multilingual Language Model EvaluationArabic NLP

  21. Evaluating and Mitigating Anti-LGBTQ Biases in German and Multilingual Language Models

    Aug 31, 2026Melina Morch, Daniel BraunMultilingual Language Model EvaluationSocial Bias in Language Models

  22. More Capable, Less Faithful: A Multilingual Analysis of Mathematical (Un)Solvability Detection in LLMs

    Aug 31, 2026Maria-Eleni Zoumpoulidi, Nikolaos Xiros, Georgios ParaskevopoulosMultilingual Language Model EvaluationLLM Reliability

  23. Do Small Models Use the Law You Give Them? Measuring Context Use on a Bilingual Bangladesh Legal Benchmark

    Aug 31, 2026Moniruzzaman Mahadi, Abrar Mohammed Tanzim Alam, Sayma Siddika Monalisa +3Multilingual Language Model EvaluationLLM Evaluation

  24. Pak3H: Evaluating the Cost of Cultural Mismatch in LLM Alignment with a Human-Contextualized Urdu Benchmark

    Aug 30, 2026Abdullah Hashmat, Usman Naseem, Agha Ali RazaMultilingual Language Model EvaluationLLM Alignment