Multilingual Language Model Evaluation

Latest papers 309

All topics
CardsList
  1. Validity of LLMs as data annotators: AMALIA on authority

    Jul 9, 2026Manuel PitaMultilingual Language Model EvaluationMoral Reasoning in Language Models

  2. Echoes Across Vietnam's Highlands, Delta, and Coast: A Multilingual Corpus for Cham, Khmer, and Tay-Nung

    Jul 9, 2026Anh Trac Duc Dinh, Khang Nhat Hoang Vo, Vinh Cong Doan +2Multilingual Language Model EvaluationMultilingual IR

  3. Scalable and Culturally Specific Stereotype Dataset Construction via Human-LLM Collaboration

    Jul 8, 2026Weicheng Ma, John Guerrerio, Soroush VosoughiMultilingual Language Model EvaluationSocial Bias in Language Models

  4. PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents

    Jul 7, 2026Hongliang Li, Yijin Liu, Zhiwei Zhang +5Multilingual Language Model EvaluationLong-Horizon Agent Evaluation

  5. PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages

    Jul 7, 2026Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl +14Mathematical Reasoning BenchmarksMultilingual Language Model Evaluation

  6. CrossHallu: Do Hallucination Signals Generalize Across Languages and Domains in Large Language Model's Internals?

    Jul 4, 2026Aisha Alansari, Malak Alkhorasani, Hamzah LuqmanMultilingual Language Model EvaluationLLM Hallucination Detection

  7. Challenges and Recommendations for LLM-as-a-Judge in Multilingual Settings and for Low-Resource Languages

    Jul 2, 2026A. Seza Doğruöz, Xixian Liao, Verena Blaschke +3Multilingual Language Model EvaluationLLM-as-a-Judge

  8. Safety Targeted Embedding Exploit via Refinement

    Jul 2, 2026Joshua Adrian CahyonoMultilingual Language Model EvaluationAdversarial Attacks on LLMs

  9. Evaluating Large Language Model Raters for German Open-Response Clinical Questions: A Physician-Annotated Benchmark Study of Agreement, Evaluator Bias, and Abstention

    Jul 1, 2026William Philipp, Finn Fassbender, Daniel Fister +12Multilingual Language Model EvaluationLLM-as-a-Judge

  10. MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages

    Jul 1, 2026Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo +19Language Model PretrainingSynthetic Data Pretraining

  11. MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark

    Jul 1, 2026Xianru Chen, Yukai Huang, Mingxiang Chen +6Multilingual Language Model EvaluationLLM Evaluation

  12. Indi-RomCoM: Code-Mixed Benchmark for Evaluating LLMs on Romanized Indic-English Instructions

    Jun 29, 2026Avisha Das, Mihir Parmar, Mohana Ramnath +1Multilingual Language Model EvaluationInstruction Following

  13. The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning

    Jun 27, 2026Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm +8LLM Safety BenchmarksMultilingual Language Model Evaluation

  14. A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

    Jun 24, 2026Abrar Alotaibi, Raed Mughus, Moataz AhmedMultilingual Language Model EvaluationLLM Evaluation

  15. Same Lesson, Different Story: Cross-Lingual Reconstruction of Cultural Narratives in Large Language Models

    Jun 23, 2026Jory Alshaalan, Haya Albaker, Abeer Aldayel +2Multilingual Language Model EvaluationLLM Grounding

  16. A Pāninian Foundation for Indic Language Processing

    Jun 23, 2026Ritwik Banerjee, Lav R. VarshneyMultilingual Language Model EvaluationLow-Resource Language Processing

  17. Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts

    Jun 22, 2026Arthur Wuhrmann, Gaetan Stein, Daniel Brunner +1Multilingual Language Model EvaluationLegal NLP

  18. Language-Specific Sentiment Polarity Biases in Encoder and Large Language Model Classification of Product Reviews

    Jun 22, 2026Advita Rajiv, Kavitha Kothur, Gautham ReddyMultilingual Language Model EvaluationLLM Evaluation

  19. BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

    Jun 21, 2026João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz +2Multilingual Language Model EvaluationLLM Evaluation

  20. Are Multilingual Models Actually Improving? Isolating True Cross-Lingual Transfer

    Jun 20, 2026Prasoon Bajpai, Eleftheria Briakou, Colin Cherry +2Multilingual Language ModelsMultilingual Language Model Evaluation

  21. The Language-Energy Divide: Measuring Energy Costs of Multilingual LLM Inference

    Jun 20, 2026Naihao Deng, Alissa Shen, Yiming Feng +5LLM Inference EfficiencyMultilingual Language Models

  22. Behavioral and Representational Evidence of Binomial Ordering Preferences in Large Language Models

    Jun 19, 2026Zhiqing Yang, Yilun Liu, Yunpu Ma +2Multilingual Language Model EvaluationLLM Interpretability