Multilingual Language Model Evaluation

Latest papers 309

All topics
CardsList
  1. MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning

    Jul 13, 2026Ayoung Lee, Ryan Kwon, Yunxiang Zhang +3Multilingual Language Model EvaluationMoral Reasoning in Language Models

  2. Validity of LLMs as data annotators: AMALIA on authority

    Jul 9, 2026Manuel PitaMultilingual Language Model EvaluationMoral Reasoning in Language Models

  3. Echoes Across Vietnam's Highlands, Delta, and Coast: A Multilingual Corpus for Cham, Khmer, and Tay-Nung

    Jul 9, 2026Anh Trac Duc Dinh, Khang Nhat Hoang Vo, Vinh Cong Doan +2Multilingual Language Model EvaluationMultilingual IR

  4. Scalable and Culturally Specific Stereotype Dataset Construction via Human-LLM Collaboration

    Jul 8, 2026Weicheng Ma, John Guerrerio, Soroush VosoughiMultilingual Language Model EvaluationSocial Bias in Language Models

  5. PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents

    Jul 7, 2026Hongliang Li, Yijin Liu, Zhiwei Zhang +5Multilingual Language Model EvaluationLong-Horizon Agent Evaluation

  6. PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages

    Jul 7, 2026Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl +14Mathematical Reasoning BenchmarksMultilingual Language Model Evaluation

  7. CrossHallu: Do Hallucination Signals Generalize Across Languages and Domains in Large Language Model's Internals?

    Jul 4, 2026Aisha Alansari, Malak Alkhorasani, Hamzah LuqmanMultilingual Language Model EvaluationLLM Hallucination Detection

  8. Challenges and Recommendations for LLM-as-a-Judge in Multilingual Settings and for Low-Resource Languages

    Jul 2, 2026A. Seza Doğruöz, Xixian Liao, Verena Blaschke +3Multilingual Language Model EvaluationLLM-as-a-Judge

  9. Safety Targeted Embedding Exploit via Refinement

    Jul 2, 2026Joshua Adrian CahyonoMultilingual Language Model EvaluationAdversarial Attacks on LLMs

  10. Evaluating Large Language Model Raters for German Open-Response Clinical Questions: A Physician-Annotated Benchmark Study of Agreement, Evaluator Bias, and Abstention

    Jul 1, 2026William Philipp, Finn Fassbender, Daniel Fister +12Multilingual Language Model EvaluationLLM-as-a-Judge

  11. MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages

    Jul 1, 2026Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo +19Language Model PretrainingSynthetic Data Pretraining

  12. MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark

    Jul 1, 2026Xianru Chen, Yukai Huang, Mingxiang Chen +6Multilingual Language Model EvaluationLLM Evaluation

  13. Indi-RomCoM: Code-Mixed Benchmark for Evaluating LLMs on Romanized Indic-English Instructions

    Jun 29, 2026Avisha Das, Mihir Parmar, Mohana Ramnath +1Multilingual Language Model EvaluationInstruction Following

  14. The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning

    Jun 27, 2026Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm +8LLM Safety BenchmarksMultilingual Language Model Evaluation

  15. A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

    Jun 24, 2026Abrar Alotaibi, Raed Mughus, Moataz AhmedMultilingual Language Model EvaluationLLM Evaluation

  16. Same Lesson, Different Story: Cross-Lingual Reconstruction of Cultural Narratives in Large Language Models

    Jun 23, 2026Jory Alshaalan, Haya Albaker, Abeer Aldayel +2Multilingual Language Model EvaluationLLM Grounding

  17. A Pāninian Foundation for Indic Language Processing

    Jun 23, 2026Ritwik Banerjee, Lav R. VarshneyMultilingual Language Model EvaluationLow-Resource Language Processing

  18. Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts

    Jun 22, 2026Arthur Wuhrmann, Gaetan Stein, Daniel Brunner +1Multilingual Language Model EvaluationLegal NLP

  19. Language-Specific Sentiment Polarity Biases in Encoder and Large Language Model Classification of Product Reviews

    Jun 22, 2026Advita Rajiv, Kavitha Kothur, Gautham ReddyMultilingual Language Model EvaluationLLM Evaluation

  20. BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

    Jun 21, 2026João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz +2Multilingual Language Model EvaluationLLM Evaluation

  21. Are Multilingual Models Actually Improving? Isolating True Cross-Lingual Transfer

    Jun 20, 2026Prasoon Bajpai, Eleftheria Briakou, Colin Cherry +2Multilingual Language ModelsMultilingual Language Model Evaluation

  22. The Language-Energy Divide: Measuring Energy Costs of Multilingual LLM Inference

    Jun 20, 2026Naihao Deng, Alissa Shen, Yiming Feng +5LLM Inference EfficiencyMultilingual Language Models