Multilingual Language Model Evaluation

Latest papers 309

All topics
CardsList
  1. Behavioral and Representational Evidence of Binomial Ordering Preferences in Large Language Models

    Jun 19, 2026Zhiqing Yang, Yilun Liu, Yunpu Ma +2Multilingual Language Model EvaluationLLM Interpretability

  2. NRITYAM: Language Models Meet Art and Heritage of Dance

    Jun 18, 2026Punit Kumar Singh, Niladri Ghosh, Advait Joshiınst +3Multilingual Language Model EvaluationLLM Evaluation

  3. G-IdiomAlign: A Gloss-Pivoted Benchmark for Cross-Lingual Idiom Alignment

    Jun 17, 2026Fengying Ye, Yanming Sun, Runzhe Zhan +3Figurative Language UnderstandingMultilingual Language Model Evaluation

  4. When English Isn't the Best Teacher: Source Language Effects in Cross-Lingual In-Context Learning

    Jun 16, 2026Fred Philippy, Siwen Guo, Jacques Klein +1Multilingual Language Model EvaluationIn-Context Learning

  5. ChLogic: Evaluating Robustness of Logical Reasoning in Chinese Expressions

    Jun 16, 2026Peixian Zhou, Yuxu Chen, Chaorui Zhang +3Multilingual Language Model EvaluationCross-Lingual Reasoning in Language Models

  6. Extending Item Response Theory for Efficient and Meaningful Multilingual Evaluation

    Jun 14, 2026Gili Lior, Tzviel Frostig, Gabriel Stanovsky +1Multilingual Language Model EvaluationCross-Cultural Language Model Evaluation

  7. Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus

    Jun 13, 2026Yuheng Lu, Qingcheng Zeng, Heli Qi +6Multilingual Language Model EvaluationDeep Research Agents

  8. AmchiBias: Measuring Stereotypical Bias in Goan Identity Groups with a Minimal Pair Dataset in English and Konkani

    Jun 13, 2026Michelle Barbosa, Sebastian Padó, Franziska WeeberMultilingual Language Model EvaluationCultural Bias in Language Models

  9. When Similar Means Different: Evaluating LLMs on Arabic--Hebrew Cognates

    Jun 11, 2026Junhong Liang, Noor Abo Mokh, Bashar AlhafniMultilingual Language Model EvaluationArabic NLP

  10. MÖVE: A Holistic LLM Benchmark for the German Public Sector

    Jun 11, 2026Camilla Dalerci, Thilo Michael, Robin Schaefer +1Multilingual Language Model EvaluationLLM Evaluation

  11. Polar: A Benchmark for Evaluating Political Bias in LLMs

    Jun 11, 2026Sangho Kim, Heejin Kim, Yoonhee Park +2Multilingual Language Model EvaluationPolitical Bias in Language Models

  12. AfriSUD: A Dependency Treebank Collection for Evaluating Models on African Languages

    Jun 10, 2026Happy Buzaaba, Cheikh Mouhamadou Bamba Dione, David Ifeoluwa Adelani +15Multilingual Language Model EvaluationMorphosyntactic Tagging

  13. Schützen: Evaluating LLM Safety in Bulgarian and German Contexts

    Jun 9, 2026Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  14. The Shibboleth Effect: Auditing the Cross-Lingual Distributional Skew of Large Language Models

    Jun 9, 2026Hakan MehmetcikMultilingual Language Model EvaluationLLM Auditing

  15. Who Brought Easter Eggs to Eid? Auditing LLM-Generated Cultural Translation of Math Word Problems Across Languages and Regions

    Jun 9, 2026Parisa Suchdev, Juniper LovatoMultilingual Language Model EvaluationCultural Bias in Language Models

  16. BenSyc: Benchmarking Conversational Sycophancy and Human Alignment in LLMs for Bengali Contexts

    Jun 8, 2026Kazi Noshin, Sajib Acharjee Dip, Ranat Das Prangon +4Multilingual Language Model EvaluationLLM Evaluation

  17. Friend or Foe? Language as an ideological switch in open-weight LLMs under Russian disinformation stress

    Jun 7, 2026Anna Małgorzata Kamińska, Tetiana KlyninaMultilingual Language Model EvaluationPolitical Bias in Language Models

  18. Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems

    Jun 6, 2026Muhammad Falensi Azmi, Ikhlasul Akmal Hanif, Vallerie Alexandra Putra +3VLM EvaluationVLM Robustness

  19. Beyond English benchmarks: clinical llm evaluation in Brazilian Portuguese

    Jun 5, 2026Giordano de Pinho Souza, Glaucia Melo, Josefino Cabral Melo Lima +1Multilingual Language Model EvaluationClinical Decision-Making

  20. The Masked Advantage: Uncovering Local-Language Access to Cultural Knowledge in LLMs

    Jun 5, 2026Yang Zhang, Xiao Fei, Amr Mohamed +6Multilingual Language Model EvaluationLLM Evaluation

  21. MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models

    Jun 5, 2026Rishabh Makwana, Mamta, Deeksha Varshney +1VLM EvaluationVLM Robustness

  22. mmPISA-bench: Do LLMs Reason Equally Well Across 43 Languages?

    Jun 5, 2026Yerzhan Sapenov, Jaromir SavelkaMultilingual Language ModelsMultilingual Language Model Evaluation