Multilingual Benchmark

Latest papers 151

All topics
CardsList
  1. BabelFake: A Multilingual Audio-Visual DeepFake Benchmark

    Oct 5, 2026Carlotta Segna, Joel Tschesche, Anna RohrbachMultilingual BenchmarkMultilingual Automatic Speech Recognition

  2. SHAMS: An Audio-Grounded Pronunciation Benchmark for Levantine Arabic

    Oct 1, 2026Ben Sapirstein, Roy Mattar, Guy Mor-Lan +3Arabic Natural Language ProcessingArabic

  3. Precision over Scale: A Polish-Silesian Benchmark and a Translation System Outperforming Open-Source and Commercial Models

    Oct 1, 2026Grzegorz Kulik, Mikołaj Pokrywka, Adam Jatowt +1Multilingual BenchmarkPrecision

  4. Billiger.de Products: A Bilingual Entity Matching Benchmark

    Sep 29, 2026Aaron Steiner, Ksenia Elagin, Ralph Peeters +2Multilingual Benchmark

  5. Benchmarking Automatic Speech Recognition Tools for Iberian Languages

    Sep 29, 2026Fernando López, Pablo Gómez, David Solans +2Automatic Speech Recognition EvaluationMultilingual Automatic Speech Recognition

  6. Almieyar: A Culturally Grounded Benchmark for Multi-Dialect Arabic Speech Recognition

    Sep 28, 2026Omid Ghahroodi, Anas Madkoor, Dima Faris Al Saudi +37Arabic Natural Language ProcessingArabic

  7. BaatCheet: A Multilingual Corpus for Dialogue Translation in Indian Languages

    Sep 27, 2026Priyanka Dasari, Yuvrajsinh D. Bodana, Vandan Mujadia +3Translation QualityMultilingual Benchmark

  8. Two Emojis of Difference: What Multilingual Affective Generation Benchmarks Actually Measure

    Sep 24, 2026Fardeen Sadab, Adib SakhawatMultilingual BenchmarkHuman Annotators

  9. MSI-Bench: Evaluating Multi-Speaker Voice Interaction for Collaborative AI Agents

    Sep 21, 2026Chenxu Xiong, Dongming Shen, Yuzhi Tang +3Full-Duplex Voice AgentsDialogue Benchmarks

  10. Vimarsha: Faithful ASR Evaluation for Indian Languages with Demographic Diversity, In-the-Wild Audio and Spelling Variations

    Sep 21, 2026Kaushal Santosh Bhogale, Srija Anand, Sadakopa Ramakrishnan Thothathiri +3Automatic Speech Recognition EvaluationIndian Languages

  11. BabelArena: A Large-Scale Multilingual Benchmark for LLM Agents

    Sep 20, 2026Peng Kuang, Yuchun Fan, Jiangnan Li +7Multilingual AgentsMultilingual Benchmark

  12. MuLA-Bench: A Multilingual Long-Form Audio Understanding Benchmark via Multi-Tier Auditing

    Sep 20, 2026Zeyu Yang, Xinyu Zhang, Zibo Bi +5Multilingual BenchmarkAcoustic Latent Space

  13. Beyond Word Error Rate: A Switch Aware Evaluation of ASR and Audio Language Models on English Yoruba Code-Switched Speech

    Sep 12, 2026Chibuzor Okocha, Christan Earl GrantCode-SwitchingAutomatic Speech Recognition Evaluation

  14. Prompt Revision as a Source of Cultural Bias in Text-to-Image Systems

    Sep 12, 2026Aleksandra Urman, Elsa Lichtenegger, Salima Jaoua +7Stereotype MitigationText Generation

  15. 5-Dialects-BN: Unmasking the Impact of Transliteration on Bangla Dialectal LLMs

    Sep 9, 2026Md Mahir Jawad, Galib Mahmud Jim, Rafid Ahmed +3DialectsBangla

  16. SEA-SpeechBench: A Large-Scale Multitask Benchmark for Speech Understanding Across Southeast Asia

    Sep 9, 2026Jingyi Liao, Wenyu Zhang, Zhuohan Liu +6Multilingual BenchmarkThai

  17. BanglaMemeX: Advancing Cultural Metaphoric Image Interpretation in Bangla with a Multimodal Explainable Dataset

    Sep 7, 2026Md. Sadman Sakib, Zisan Mahmud, Md. Fahim Arefin +1BanglaMetaphors

  18. Beyond BLEU: A Case for Redefining Sign Language Translation Benchmarks

    Sep 3, 2026Oline Ranum, Edward Fish, Simon Hadfield +1Gloss-Free Sign Language TranslationSign Language Translation

  19. MemeCULT-1K: Benchmarking South Asian Cultural Context and Humor Understanding of Multimodal Models

    Sep 1, 2026Tawsif Tashwar Dipto, Mehedi Ahamed, Radib Bin Kabir +5MemesCultural Awareness

  20. EDRAC: Benchmarking Arabic Dialect Reading Comprehension

    Sep 1, 2026Noor Abo Mokh, Kirill Chirkunov, Teresa Lynn +15Arabic Natural Language ProcessingArabic

  21. WorldBench: Culturally Grounded Benchmark for Multilingual Agents

    Sep 1, 2026Leonardo Ranaldi, Sherrie Shen, Jushi Kai +1Multilingual AgentsAgentic Benchmarks

  22. Latent Mechanisms of Language Control in Multilingual Language Models

    Aug 31, 2026Ryo Mitsuhashi, Sabri Boughorbel, Majd HawaslyMultilingual Language ModelsCode-Switching

  23. Evaluating and Mitigating Anti-LGBTQ Biases in German and Multilingual Language Models

    Aug 31, 2026Melina Morch, Daniel BraunLarge Language Model BiasMultilingual Benchmark

  24. BavGround: A Benchmark for Regional Cultural Grounding and Dialect Competence in Bavarian

    Aug 13, 2026Jophin John, Michael Hoffmann, Jan Fillies +2Multilingual BenchmarkDialects

  25. VICBench: A Multi-Language Benchmark for Code Vulnerability Detection

    Aug 12, 2026Jin Lu, Xuening Han, Yang Zhong +4Common Vulnerabilities And ExposureBenchmark Datasets

  26. From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models

    Aug 11, 2026Si'an Xie, Jiaxun Liu, Biao Yang +4Large Language Model BenchmarksReasoning Skills

  27. VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation

    Aug 11, 2026Yejin Jeon, Marie Maltais, Virginia Ceccatelli +2SummarizationMultilingual Benchmark

  28. Cultivar: A Contrastive and Locale-Oriented Translation Benchmark for Investigating Contamination and Localisation Robustness

    Aug 10, 2026Pinzhen Chen, Koel Dutta Chowdhury, Xiaoya Xu +20Multilingual BenchmarkContrastive Learning

  29. SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

    Aug 8, 2026Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah +11Multilingual SafetyLarge Language Model Safety

  30. Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation

    Aug 7, 2026Anna Kołos, Grzegorz Statkiewicz, Karolina Seweryn +3Multilingual BenchmarkMultimodal Benchmarks

  31. MultiGlobeQA: A Multilingual and Globally Diverse Benchmark for Geospatial Reasoning

    Aug 4, 2026Martin Böckling, Elizaveta Nosova, Heiko Paulheim +1Geospatial ReasoningMultilingual Benchmark

  32. ConlangBench: Exploring Language Knowledge and Learning in LLMs through Diverse Constructed Languages

    Aug 4, 2026Jinhong Jeong, Seungyeop Yi, Sangah Lee +1Multilingual BenchmarkLarge Language Model Benchmarks

  33. Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

    Jul 26, 2026Deovrat Mehendale, Aditya Mehndiratta, Dhruv Rathi +2Speaker DiarizationMultilingual Automatic Speech Recognition

  34. PatiGonit22K: A Comprehensive Dataset for Solving Complex Bengali MWPs

    Jul 24, 2026Swastika Kundu, Azizul Hakim Fayaz, Tashreef MuhammadBanglaMath Problems

  35. Overview of FinMMEval 2026 Task 1: Multilingual Financial Multiple-Choice Question Answering

    Jul 22, 2026Zhuohan Xie, Yuyang Dai, Rania Elbadry +18Multilingual BenchmarkFinancial Question Answering

  36. ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

    Jul 20, 2026Fernando López, Ana Ayala, Guillermo Segovia +4Automatic Speech Recognition EvaluationLarge Audio Language Models

  37. KyrgyzLLM-Bench: Benchmarking Kyrgyz Language Understanding

    Jul 19, 2026Timur Turatali, Aida Turdubaeva, Rustem Izmailov +2Multilingual Benchmark

  38. Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

    Jul 16, 2026Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez +5Code GenerationMultilingual Benchmark

  39. Meta-Learning Preferences for Multilingual LLM Alignment

    Jul 14, 2026Jiaying Lin, Seongho Son, Nam Phuong Tran +3Large Language Model AlignmentMotion-Language Alignment

  40. Beyond Benchmarks: Exposing the Hidden Crisis in Bangla Hate Speech Detection

    Jul 13, 2026Faria Afrin Tisha, Fariya Tabassum, Hafsa Binte Kibria +2Hate Speech DetectionBangla

  41. Do LLMs Fabricate Legal Citations? A Bilingual Benchmark on Saudi Data Protection Law and the GDPR

    Jul 13, 2026Noura Suliman AlrajehLegal DomainCitations

  42. Test-Time Scaling for Small VLMs on Multilingual Visual MCQ

    Jul 10, 2026Spiros Baxevanakis, Peng-Jian YangTest-Time ScalingMultilingual Benchmark

  43. Scalable and Culturally Specific Stereotype Dataset Construction via Human-LLM Collaboration

    Jul 8, 2026Weicheng Ma, John Guerrerio, Soroush VosoughiStereotype MitigationMultilingual Benchmark

  44. PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages

    Jul 7, 2026Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl +14Multilingual BenchmarkTable Reasoning Datasets

  45. MORE: A Multilingual Document Parsing Benchmark and Evaluation

    Jul 3, 2026Long Xu, Binghong Wu, Tinghao Yu +6Multilingual BenchmarkMultilingual

  46. MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark

    Jul 1, 2026Xianru Chen, Yukai Huang, Mingxiang Chen +6Multilingual BenchmarkMultilingual

  47. Indi-RomCoM: Code-Mixed Benchmark for Evaluating LLMs on Romanized Indic-English Instructions

    Jun 29, 2026Avisha Das, Mihir Parmar, Mohana Ramnath +1Multilingual BenchmarkMultilingual

  48. BackTranslation2.0 -- A Linguistically Motivated Metric to Assess Sign Language Production

    Jun 27, 2026Oliver Cory, Maksym Ivashechkin, Karahan Sahin +6Sign Language TranslationMultilingual Benchmark

  49. Multilingual Reasoning Cascades Need More Context

    Jun 25, 2026Arnav Mazumder, Dengjia Zhang, Shuyue Stella Li +2Multilingual Benchmark

  50. RedVox: Safety and Fairness Gaps in Speech Models Across Languages

    Jun 25, 2026Beatrice Savoldi, Sara Papi, Wafa Aissa +2Multilingual SafetyLarge Language Model Safety

  51. Multilingual Hematology Visual Question Answering Dataset

    Jun 24, 2026Hajra Malik, Hafiza Tooba Aftab, Abdul Rehman +2Multilingual Healthcare Q&AUrdu

  52. Cross-Lingual Exploration for Parametric Knowledge

    Jun 23, 2026Elisha Diskind, Itamar Trainin, Uri Shaham +3Cross-Lingual ConsistencyCross-Lingual Transfer