Multilingual Language Model Evaluation

Latest papers 309

All topics
CardsList
  1. Generative vs. Encoder Models for Multilingual NER: A Comprehensive Empirical Study on Naamapadam

    Aug 30, 2026Jakkala Mahesh, Jatavath Shravan Kumar, Komalla Shivani +1Named Entity RecognitionMultilingual Language Model Evaluation

  2. Apples to Apples? Towards Comparable Crosslingual Language Model Evaluation

    Aug 25, 2026Xiulin Yang, Ethan Gotlieb Wilcox, Catherine ArnettMultilingual Language Model EvaluationLLM Evaluation

  3. BavGround: A Benchmark for Regional Cultural Grounding and Dialect Competence in Bavarian

    Aug 13, 2026Jophin John, Michael Hoffmann, Jan Fillies +2Multilingual Language Model EvaluationLLM Grounding

  4. From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch

    Aug 10, 2026Laurens Samson, Iva Gornishka, Gossa Lô +2Multilingual Language Model EvaluationLLM Evaluation

  5. Hidden Language Consistency Phenomena in Reasoning LLMs

    Aug 9, 2026Muhammad Ali Shafique, Kelly MarchisioMultilingual Language ModelsMultilingual Language Model Evaluation

  6. Wisdom in Unity: The Role of Multilingual Training in Figurative Language Identification in Proverbs

    Aug 8, 2026Rama Alomair, Remas Alsubaie, Walaa Saifalislam +5Figurative Language UnderstandingMultilingual Language Models

  7. SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

    Aug 8, 2026Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah +11LLM Safety BenchmarksMultilingual Language Model Evaluation

  8. Grammar Engineering Meets LLMs: Development of Cantonese and Irish ParGram Treebanks

    Aug 7, 2026Chit-Fung Lam, Elaine Uí DhonnchadhaMultilingual Language Model EvaluationStructured Output Generation

  9. MameLoshnLM: Yiddish Language Model and Evaluation Benchmark

    Aug 6, 2026Uri Katz, Omer Goldman, Tomasz Limisiewicz +2Language Model PretrainingMultilingual Language Model Evaluation

  10. MultiGlobeQA: A Multilingual and Globally Diverse Benchmark for Geospatial Reasoning

    Aug 4, 2026Martin Böckling, Elizaveta Nosova, Heiko Paulheim +1Multilingual Language Model EvaluationSpatial Reasoning Benchmarks

  11. Predicting Multilingual Classification and Translation Performance of LLMs with Cross-Lingual Alignment \unicodex2013\unicode{x2013} Is English Enough?

    Aug 4, 2026Adnan Al Ali, Kathy Hämmerl, Jindřich Libovický +1Multilingual Language Model EvaluationCross-Lingual Representation Alignment

  12. VIVID: A Culturally Grounded Benchmark Exposing the Figurative Language Gap in Vietnamese NLP

    Aug 4, 2026Tu Tran Do, Nhat Ngoc Nguyen, Khanh-Tung Tran +3Figurative Language UnderstandingMultilingual Language Model Evaluation

  13. Semantic Alignment of AI Models: Concept Collapse, Checkpoint Dynamics, and Cross-Lingual Transfer

    Aug 3, 2026Tyler Ashoff, Jordan RoduMultilingual Language Model EvaluationRepresentation Geometry in Language Models

  14. Same violence, different answer: how AI responds to coercive control against women across languages

    Aug 2, 2026Lyu Chang, Sònia Estradé Albiol, Núria Vergés BoschMultilingual Language Model EvaluationLanguage Model Safety Evaluation

  15. Language Equality has a Price: A Systematic Investigation of Multi-turn LLM Performance for EU-24+

    Aug 2, 2026Sherzod Hakimov, Karl Osswald, Jelle Psurek +3Multilingual Language Model EvaluationLLM Evaluation

  16. MORFES: A Benchmark for Productive Inflectional Competence in Modern Greek

    Jul 30, 2026Ioakeim Perros, Cleopatra Papadopoulou, Ayoub Kirouane +1Multilingual Language Model EvaluationLLM Evaluation

  17. Language Shapes Instruction Hierarchy Compliance in Multilingual LLMs

    Jul 26, 2026Jiwon Moon, Yerin Hwang, Kyomin JungMultilingual Language Model EvaluationLLM Security

  18. Do Small Models Use the Law You Give Them? Context-Injected Fine-Tuning for Legal QA in Bangladesh

    Jul 26, 2026Moniruzzaman Mahadi, Abrar Mohammed Tanzim Alam, Sayma Siddika Monalisa +3Multilingual Language Model EvaluationLLM Grounding