Multilingual Language Model Evaluation

Latest papers 309

All topics
CardsList
  1. DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection

    May 15, 2026Junchao Wu, Yefeng Liu, Chenyu Zhu +8Multilingual Language Model EvaluationAI-Generated Text Detection

  2. Dimension-Level Intent Fidelity Evaluation for Large Language Models: Evidence from Structured Prompt Ablation

    May 14, 2026GAng PengMultilingual Language Model EvaluationLLM Evaluation

  3. Knowledge Beyond Language: Bridging the Gap in Multilingual Machine Unlearning Evaluation

    May 14, 2026Kyomin Hwang, Hyeonjin Kim, Sangyeon Cho +1Multilingual Language Model EvaluationPrivacy Leakage in Language Models

  4. StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs

    May 11, 2026Pierre Le Jeune, Étienne Duchesne, Weixuan Xiao +4Open-Ended GenerationMultilingual Language Model Evaluation

  5. From Traditional Taggers to LLMs: A Comparative Study of POS Tagging for Medieval Romance Languages

    May 9, 2026Matthias Schöffel, Esteban Garces AriasMultilingual Language Model EvaluationMorphosyntactic Tagging

  6. Why Global LLM Leaderboards Are Misleading: Small Portfolios for Heterogeneous Supervised ML

    May 7, 2026Jai Moondra, Ayela Chughtai, Bhargavi Lanka +1Multilingual Language Model EvaluationLLM Evaluation

  7. Benchmarking POS Tagging for the Tajik Language: A Comparative Study of Neural Architectures on the TajPersParallel Corpus

    May 6, 2026Mullosharaf K. ArabovMultilingual Language Model EvaluationMorphosyntactic Tagging

  8. Nsanku: Evaluating Zero-Shot Translation Performance of LLMs for Ghanaian Languages

    May 5, 2026Stephen E. Moore, Mich-Seth Owusu, Akwasi Asare +13Multilingual Language Model EvaluationOpen-Weight Language Models

  9. SemEval-2026 Task 7: Everyday Knowledge Across Diverse Languages and Cultures

    May 4, 2026Nedjma Ousidhoum, Junho Myung, Carla Perez-Almendros +27Multilingual Language Model EvaluationLLM Evaluation

  10. A multilingual hallucination benchmark: MultiWikiQHalluA

    May 4, 2026Freja Thoresen, Dan Saattrup SmartMultilingual Language ModelsMultilingual Language Model Evaluation

  11. Reliability-Oriented Multilingual Orthopedic Diagnosis: A Domain-Adaptive Modeling and a Conceptual Validation Framework

    May 4, 2026Danish Ali, Li Xiaojian, Sundas Iqbal +1Multilingual Language Model EvaluationHealthcare

  12. Auditing demographic bias in AI-based emergency police dispatch: a cross-lingual evaluation of eleven large language models

    May 2, 2026William Guey, Wei Zhang, Pierrick Bougault +4Multilingual Language Model EvaluationLLM Auditing

  13. Artificial intelligence language technologies in multilingual healthcare: Grand challenges ahead

    May 2, 2026Vicent Briva-IglesiasMultilingual Language Model EvaluationLanguage Model Safety Evaluation

  14. Lost in the Tower of Babel: The Adverse Effects of Incidental Multilingualism in LLMs

    May 2, 2026Anjishnu Mukherjee, Chutong Meng, Antonios AnastasopoulosMultilingual Language ModelsMultilingual Language Model Evaluation

  15. FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios

    May 1, 2026Yutao Hou, Yihan Jiang, Yuhan Xie +5Multilingual Language Model EvaluationLanguage Model Safety Evaluation

  16. Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues

    Apr 30, 2026Muhammad Dehan Al Kautsar, Saeed Almheiri, Momina Ahsan +13Multilingual Language Model EvaluationArabic NLP

  17. Cross-Lingual Response Consistency in Large Language Models: An ILR-Informed Evaluation of Claude Across Six Languages

    Apr 29, 2026Camelia BalutaMultilingual Language ModelsMultilingual Language Model Evaluation

  18. Zero-Shot to Full-Resource: Cross-lingual Transfer Strategies for Aspect-Based Sentiment Analysis

    Apr 29, 2026Jakob Fehle, Nils Constantin Hellwig, Udo Kruschwitz +1Multilingual Language Model EvaluationAspect-Based Sentiment Analysis

  19. Cross-Lingual Jailbreak Detection via Semantic Codebooks

    Apr 28, 2026Shirin Alanova, Bogdan Minko, Sabrina Sadiekh +1Multilingual Language Model EvaluationLLM Security

  20. Do LLMs Capture Embodied Cognition and Cultural Variation? Cross-Linguistic Evidence from Demonstratives

    Apr 28, 2026Yu Wang, Emmanuele Chersoni, Chu-Ren HuangMultilingual Language Model EvaluationLLM Grounding

  21. Disentangling Linguistic Relatedness from Task Alignment in Cross-Lingual Transfer

    Apr 26, 2026Ahmed Haj Ahmed, Ruochen Zhang, Alvin GrissomMultilingual Language Model EvaluationLLM Fine-Tuning

  22. IdiomX A Multilingual Benchmark for Idiom Understanding, Retrieval, and Interpretation

    Apr 25, 2026Ayman Ali ShararaFigurative Language UnderstandingMultilingual Language Model Evaluation

  23. Multilingual Refusal Alignment for Safer Large Language Models

    Apr 24, 2026Aleksandra Krasnodębska, Wojciech Kusa, Aldo LipaniMultilingual Language Model EvaluationLLM Alignment

  24. Why are all LLMs Obsessed with Japanese Culture? On the Hidden Cultural and Regional Biases of LLMs

    Apr 23, 2026Joseba Fernandez de Landa, Carla Perez-Almendros, Jose Camacho-ColladosMultilingual Language Model EvaluationCultural Bias in Language Models