Multilingual Language Model Evaluation

Latest papers 309

All topics
CardsList
  1. Evaluating Cross-lingual Knowledge Consistency in Code-Mixed vis-a-vis Indian Languages using IndicKLAR

    May 28, 2026Debajyoti Mazumder, Divyansh Pathak, Prashant Kodali +3Multilingual Language Model EvaluationCross-Lingual Reasoning in Language Models

  2. Can Large Language Models Handle Discourse Particles? A Case Study of Colloquial Malay

    May 27, 2026Mariah Al Giptiah Binte Yusoff, Jakin Tan, Bocheng Chen +2Multilingual Language Model EvaluationPragmatic Reasoning in Language Models

  3. Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study

    May 27, 2026Irune Zubiaga, Aitor Soroa, Rodrigo AgerriMultilingual Language Model EvaluationLLM-as-a-Judge

  4. Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning

    May 27, 2026Zhikai Pan, Chih-Ting Liao, Chunrui Liu +5LLM World ModelsMultilingual Language Model Evaluation

  5. DEPART: DEcomposing PARiTy across Multilingual LLMs

    May 27, 2026Manan Uppadhyay, Prashant Kodali, Pranjal Chitale +3Multilingual Language Model EvaluationCross-Lingual Reasoning in Language Models

  6. MIRA: A Bilingual Benchmark for Medical Information Response Audit

    May 27, 2026Mengyu Xu, Qiaoxin Yang, Qianqian Wang +3Multilingual Language Model EvaluationHealthcare

  7. The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages

    May 27, 2026Eric Onyame, Runtao Zhou, Kowshik Thopalli +2CoT FaithfulnessMultilingual Language Model Evaluation

  8. Disentangling Language Roles in Multilingual LLM Task Execution

    May 26, 2026Qishi Zhan, Minxuan Hu, Seoyeon Jang +7Multilingual Language ModelsMultilingual Language Model Evaluation

  9. JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors

    May 26, 2026Jiho Jin, Junho Myung, Juhyun Oh +5Multilingual Language Model EvaluationLLM-as-a-Judge

  10. Rethinking the Multilingual Reasoning Gap with Layer Swap

    May 26, 2026Maxence Lasbordes, Amélie Chatelain, Djamé SeddahMultilingual Language ModelsMultilingual Language Model Evaluation

  11. Forgotten Words: Benchmarking NeoBERT for Dementia Detection in Low-Resource Conversational Filipino and English Speech

    May 25, 2026Rez Samantha Z. Floresca, Edric Castel C. Hao, Hannah Grachiella Buñales +3Multilingual Language Model EvaluationSpeech-Based Dementia Detection

  12. On the Limits of Model Merging for Multilinguality in Pre-Training

    May 25, 2026Seth Aycock, Fedor Vitiugin, Aleksandr Umnov +2Language Model PretrainingMultilingual Language Models

  13. Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation

    May 24, 2026Klaudia-Doris Thellmann, Bernhard Stadler, Michael Färber +1Multilingual Language Model EvaluationMT Evaluation

  14. DFKI-MLT at SemEval-2026 TASK 7: Steering Multilingual Models Towards Cultural Knowledge

    May 21, 2026Yusser Al Ghussin, Daniil Gurgurov, Yasser Hamidullah +3Multilingual Language ModelsMultilingual Language Model Evaluation

  15. Do LLMs Know What Luxembourgish Borrows? Probing Lexical Neology in Low-Resource Multilingual Models

    May 20, 2026Nina Hosseini-KivananiMultilingual Language Model EvaluationKnowledge Augmentation for Language Models

  16. Lost in Interpretation: The Plausibility-Faithfulness Trade-off in Cross-Lingual Explanations

    May 19, 2026Somnath Banerjee, Pranav Jha, Rima Hazra +1Multilingual Language Model EvaluationFaithfulness of Language Model Explanations

  17. Prompting language influences diagnostic reasoning and accuracy of large language models

    May 18, 2026Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed +1Multilingual Language Model EvaluationLLM Prompting

  18. How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking

    May 18, 2026Rafid Ahmed, Intesar Tahmid, Mir Sazzat Hossain +3VLM EvaluationMultilingual Language Model Evaluation

  19. LLMs for automatic annotation of Mandarin narrative transcripts

    May 17, 2026Qingwen Zhao, Hongao Zhu, Yunqi He +3Multilingual Language Model EvaluationLLM-Assisted Annotation

  20. PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media

    May 16, 2026Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan +3Multilingual Language Model EvaluationContent Moderation