Multilingual Language Model Evaluation

Latest papers 309

All topics
CardsList
  1. Document-Level Text Simplification in Estonian Using Large Language Models

    Oct 7, 2026Meeri-Ly Muru, Eduard BarbuLow-Resource Language ProcessingLanguage Model Generation Evaluation

  2. Which Language Should a Skeleton Speak? Language Choices in Multilingual Reasoning

    Oct 7, 2026HyeonSeok Lim, SeungWoo Song, Inho Won +3LLM ReasoningCross-Lingual Reasoning in Language Models

  3. sk-bench: A Native-First Benchmark for Evaluating Large Language Models in Slovak

    Oct 6, 2026Marek Šuppa, Ivan Vykopal, Andrej Ridzik +9LLM EvaluationMultilingual Language Model Evaluation

  4. The Missing Minimal Pair: Stereotype Evaluation in LLMs

    Oct 6, 2026Nataliya Stepanova, Ivan Titov, Emily Allaway +1Multilingual Language Model EvaluationSocial Bias in Language Models

  5. Are Language Models Script-Aware?

    Oct 6, 2026David Kletz, Sandra Mitrović, Ljiljana Dolamić +1Multilingual Language ModelsMultilingual Language Model Evaluation

  6. Multilingual GSM-Symbolic: What determines capability transfer across languages?

    Oct 2, 2026Kenneth Enevoldsen, Riley Herchert, Sofie Mosegaard +22Mathematical Reasoning BenchmarksMultilingual Language Model Evaluation

  7. Evaluating and Benchmarking the System One Model Jev

    Sep 29, 2026Tobias Deußer, Lorenz Sparrenberg, Rafet SifaMultilingual Language Model EvaluationLLM Evaluation

  8. RunyaNER: Auxiliary Language Selection for Runyankore NER

    Sep 29, 2026Prosper Arineitwe Asiimwe, Francois Meyer, Jan BuysNamed Entity RecognitionMultilingual Language Model Evaluation

  9. What Does Post-Training Change in Multilingual Reasoning?

    Sep 29, 2026Hongyang Li, Xiao Li, Caesar Wu +2Multilingual Language Model EvaluationCross-Lingual Reasoning in Language Models

  10. Calibrated to Whom? Persona and Language Effects on Cultural Values in JEV

    Sep 28, 2026Bushra Asseri, Abdulaziz AsseriMultilingual Language Model EvaluationCross-Cultural Language Model Evaluation

  11. Pass or Fail? Evaluating LLMs on Two Greek Examination Benchmarks

    Sep 28, 2026Panagiota Kyriazi, Eleni Kasoura, Prokopis ProkopidisMultilingual Language Model EvaluationPrompt Sensitivity

  12. Fair Fact-Checking: Closing the Cross-Lingual Gap in LLM Factual Judgement with RoSh

    Sep 28, 2026Muhammad Ahmad, Fatemeh Seyedin, Adrian Weller +2Multilingual Language Model EvaluationAutomated Fact-Checking

  13. Two Emojis of Difference: What Multilingual Affective Generation Benchmarks Actually Measure

    Sep 24, 2026Fardeen Sadab, Adib SakhawatMultilingual Language Model EvaluationLanguage Model Generation Evaluation

  14. Language Specificity vs. Domain Diversity: Benchmarking Transformers for Bangla Medical NER

    Sep 24, 2026Rakib Abdullah, Md. Maruful Islam MarufNamed Entity RecognitionMultilingual Language Model Evaluation

  15. Evaluating Open-Weight LLMs for Turkish Domain Documents Under Retrieval and Hardware Constraints

    Sep 23, 2026Imtiaz Ul Hassan, Öykü Akbulut, Onur Kaya +4Multilingual Language Model EvaluationLLM Evaluation

  16. MWE-ECL: Recoverable Long-Range Context Does Not Always Override Local Lexical Priors

    Sep 23, 2026Wei He, Aline Villavicencio, Rodrigo Wilkens +1Multilingual Language Model EvaluationLong-Context Language Model Evaluation

  17. The Second MLC-SLM Challenge: Multilingual Conversational Speech Diarization, Recognition, and Understanding

    Sep 23, 2026Bingshen Mu, Mingchen Shao, Zhennan Lin +7Spoken Language UnderstandingMultilingual Language Model Evaluation

  18. Recognized but Not Produced: A Generation Benchmark for Culturally Specific Kinship Terms

    Sep 22, 2026Sahil Pardasani, Madhusudan SinghMultilingual Language Model EvaluationLanguage Model Generation Evaluation

  19. FineWeb-CLaR: Culture, Language, and Region Annotations for Benchmark-Aligned Corpus Auditing

    Sep 21, 2026Yusser Al Ghussin, Eva Gavaller, Cristina España-Bonet +2Multilingual Language Model EvaluationLLM Auditing

  20. BabelArena: A Large-Scale Multilingual Benchmark for LLM Agents

    Sep 20, 2026Peng Kuang, Yuchun Fan, Jiangnan Li +7Multilingual Language Model EvaluationLLM Agent Evaluation

  21. HerHealthEval: Evaluating Multilingual and Register-Sensitive Understanding of Women's Health Communication

    Sep 17, 2026Hassan Saeed Hassan Albattra, Mazen Mohammed Bahgat, Rahatara Ferdousi +2Multilingual Language Model EvaluationHealthcare

  22. Geopolitical Divisions Across Languages in Large Language Models

    Sep 17, 2026Maxim ChupilkinMultilingual Language Model EvaluationPolitical Bias in Language Models

  23. Cultural Competence in Context: A Large Language Model Passes the Turing Test in Finland

    Sep 16, 2026Otto Segersven, Pentti HenttonenMultilingual Language Model EvaluationLLM Evaluation