Multilingual Language Model Evaluation

Latest papers 309

All topics
CardsList
  1. Improving Cross-Lingual Factual Recall via Consistency-Driven Reinforcement Learning

    Jun 4, 2026Jonathan von Rad, Louis Arts, George Burgess +6Multilingual Language Model EvaluationRL for Language Models

  2. Large Language Models are Perplexed by some Political Parties

    Jun 4, 2026Paul Lerner, François YvonMultilingual Language Model EvaluationPolitical Bias in Language Models

  3. When Surface Form Changes Moderation Decisions: A Paired Study of Code-Mixed Workflow Instability

    Jun 4, 2026Suraj Babu Thimma Krishnaram, Yibo Hu, Karthikeyan SaravananMultilingual Language Model EvaluationHate Speech Detection

  4. Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

    Jun 2, 2026Hashmat Shadab Malik, Muzammal Naseer, Salman KhanMultilingual Language Model EvaluationAdversarial Attacks on VLMs

  5. Evaluating LLMs' Effectiveness on Real-World Consumer Device Repair Questions

    Jun 2, 2026Atm Mizanur Rahman, Md Arid Hasan, Syed Ishtiaque Ahmed +1Multilingual Language Model EvaluationLLM Evaluation

  6. From Script to Semantics: Prompting Strategies for African NLI

    Jun 2, 2026Anuj Tiwari, Terry Oko-odion, Hannah NwokochaMultilingual Language Model EvaluationLLM Prompting

  7. SEA-NLI: Natural Language Inference as a Lens into Southeast Asian Cultural Understanding

    Jun 2, 2026Peerawat Chomphooyod, Jian Gang Ngui, Yosephine Susanto +5Multilingual Language Model EvaluationCross-Cultural Language Model Evaluation

  8. Sample-Size Scaling of the African Languages NLI Evaluation

    Jun 2, 2026Anuj Tiwari, Oluwapelumi Ogunremu, Terry Oko-odion +2Multilingual Language Model EvaluationLow-Resource Language Processing

  9. Multilingual Idioms in Sentences and Conversations Across High-, Medium-, and Low-Resource Languages

    Jun 1, 2026Saeed Almheiri, Bilal Elbouardi, Salsabila Zahirah Pranida +16Figurative Language UnderstandingMultilingual Language Models

  10. TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages

    May 31, 2026Victor Akinode, Senyu Li, Wassim Hamidouche +3LLM Safety BenchmarksMultilingual Language Model Evaluation

  11. IndoBias: A Dual Track Culturally Grounded Benchmark for LLMs Bias Evaluation in Indonesian Languages

    May 31, 2026Ikhlasul Akmal Hanif, Muhammad Falensi Azmi, Filbert Aurelian Tjiaranata +2Multilingual Language Model EvaluationCultural Bias in Language Models

  12. Understanding LLM Behavior in Multi-Target Cross-Lingual Summarization

    May 31, 2026Sangwon Ryu, Yihong Liu, Mingyang Wang +4Multilingual Language Model EvaluationText Summarization

  13. BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali

    May 29, 2026Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham +3Multilingual Language Model EvaluationLanguage Model Error Detection

  14. LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

    May 29, 2026Krishnapriya Vishnubhotla, Sowmya Vajjala, Akriti Vij +1Multilingual Language Model EvaluationLLM-as-a-Judge

  15. On the Robustness of Multilingual Text Embedding Rankings Across Learning Tasks, Languages, and Benchmark Datasets

    May 29, 2026Ana Gjorgjevikj, Barbara Koroušić Seljak, Tome EftimovMultilingual Language Model EvaluationText Embedding Evaluation

  16. Multilingual and Cross-Lingual Citation Needed Detection on Wikipedia for Lower-Resource Languages

    May 29, 2026Gerrit Quaremba, Amy Rechkemmer, Elizabeth Black +2Multilingual Language Model EvaluationSmall Language Models

  17. Anchoring LLM Gender Bias to Human Baselines: A Cross-Lingual Audit

    May 29, 2026Jiwoo Choi, Seonwoo Ahn, Tongxin Zhang +1Gender Bias in Language ModelsMultilingual Language Model Evaluation

  18. XLGoBench: Detecting cross-lingual skill gaps with algorithmic tasks

    May 29, 2026Purvam Jain, Preethi Jyothi, Vihari Piratla +1Multilingual Language Model EvaluationCross-Lingual Reasoning in Language Models

  19. When English Rewrites Local Knowledge: Global Narrative Dominance in Large Language Models

    May 28, 2026Md Arid Hasan, Ruwad Naswan, Farhan Samir +2Multilingual Language Model EvaluationLLM Grounding