MT Evaluation

MT: Machine Translation

Latest papers 106

All topics
CardsList
  1. Model-Based Quality Assessment for Massively Multilingual Parallel Data

    May 29, 2026Abdelaziz M. A. Ibrahim, Zihao Li, Jörg Tiedemann +1Sentence EmbeddingsMT Evaluation

  2. Unlocking Fine-Grained Translation Quality Estimation in LRMs through Mutually Boosting Implicit and Explicit Reasoning

    May 29, 2026Renfei Dang, Xinye Wang, Zhejian Lai +5MT EvaluationLarge Reasoning Models

  3. AfriScience-MT: Towards Decolonizing Science in Africa through Text Translation

    May 28, 2026Idris Abdulmumin, Tajuddeen Gwadabe, Shamsuddeen Hassan Muhammad +11Scientific CommunicationLow-Resource MT

  4. Comparative Evaluation of Machine Translation Systems on Images with Text

    May 28, 2026Blai Puchol, Sergio Gómez González, Miguel Domingo +1VLM EvaluationMachine Translation

  5. HardMTBench: Stress-Testing Chinese-English Translation on Knowledge-Intensive Domains

    May 27, 2026Zheng Li, Mao Zheng, Mingyang Song +1Machine TranslationMT Evaluation

  6. Why We Need Speech to Evaluate Speech Translation

    May 27, 2026Maike Züfle, Danni Liu, Vilém Zouhar +1Speech TranslationSpeech Prosody

  7. Testing the Deliteralization Hypothesis in Human and Machine Translation

    May 25, 2026Malik Marmonier, Rachel Bawden, Benoît SagotMachine TranslationMT Evaluation

  8. Beyond Literal Translation: Evaluating Cultural Effectiveness in Social Media UGC

    May 25, 2026Linjuan Wu, Ruiqi Zhang, Xinze Lyu +7Cultural AlignmentMachine Translation

  9. Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation

    May 24, 2026Klaudia-Doris Thellmann, Bernhard Stadler, Michael Färber +1Multilingual Language Model EvaluationMT Evaluation

  10. ROC Analysis for Evaluating Translation Quality Estimation Systems

    May 23, 2026Evelyn Y. Garland, Carola F. BergerMT Evaluation

  11. Metaphors in Literary Post-Editing: Opening Pandora's Box?

    May 20, 2026Aletta G. Dorst, Mayra O. Nas, Katinka ZevenMachine TranslationMT Evaluation

  12. Ancient Greek to Modern Greek Machine Translation: A Novel Benchmark and Fine-Tuning Experiments on LLMs and NMT Models

    May 18, 2026Spyridon Mavromatis, Sokratis Sofianopoulos, Prokopis Prokopidis +1LLM Fine-TuningLow-Resource MT

  13. PaliBench: A Multi-Reference Blueprint for Classical Language Translation Benchmarks

    May 16, 2026Máté Metzger, Nadnapang PhophichitLLM EvaluationMachine Translation

  14. ForMaT: Dataset for Visually-Grounded Multilingual PDF Translation

    May 15, 2026Michał Ciesiółka, Dawid Wiśniewski, Adrian Charkiewicz +1Machine TranslationMT Evaluation

  15. CompactQE: Interpretable Translation Quality Estimation via Small Open-Weight LLMs

    May 15, 2026Kamil Guttmann, Zofia Fraś, Artur Nowakowski +1Small Language ModelsMT Evaluation

  16. Fluency and Faithfulness in Human and Machine Literary Translation

    May 14, 2026Sarah Griebel, Ted UnderwoodMachine TranslationMT Evaluation

  17. AI-assisted cultural heritage dissemination: Comparing NMT and glossary-augmented LLM translation in rock art documents

    May 14, 2026Vicent Briva-Iglesias, María Ferre-FernándezLLM PromptingCultural Heritage

  18. Creativity Bias: How Machine Evaluation Struggles with Creativity in Literary Translations

    May 13, 2026Kyo Gerrits, Rik van Noord, Ana Guerberof ArenasCreativity AssessmentLLM-as-a-Judge

  19. ATD-Trans: A Geographically Grounded Japanese-English Travelogue Translation Dataset

    May 13, 2026Shohei Higashiyama, Hiroki Ouchi, Atsushi Fujita +1Machine TranslationMT Evaluation

  20. Dynamic Meta-Metrics: Source-Sentence Conditioned Weighting for MT Evaluation

    May 9, 2026Luke Zhang, Justin Vasselli, Aditya Khan +2Metric LearningMT Evaluation

  21. Data Contamination in Neural Hieroglyphic Translation: A Reproducibility Study

    May 8, 2026Ammar Toutou, Abdelrahman Harb, Christine BastaBenchmark ContaminationLow-Resource MT

  22. Nsanku: Evaluating Zero-Shot Translation Performance of LLMs for Ghanaian Languages

    May 5, 2026Stephen E. Moore, Mich-Seth Owusu, Akwasi Asare +13Multilingual Language Model EvaluationOpen-Weight Language Models

  23. VIDA: A Dataset for Visually Dependent Ambiguity in Multimodal Machine Translation

    May 3, 2026Jingheng Pan, Xintong Wang, Longyue Wang +3Large Vision-Language ModelsMultimodal Model Evaluation

  24. Is Textual Similarity Invariant under Machine Translation? Evidence Based on the Political Manifesto Corpus

    May 1, 2026Daria Boratyn, Damian Brzyski, Albert Leśniak +5Semantic Textual SimilarityText Embedding Evaluation

  25. Cultural Benchmarking of LLMs in Standard and Dialectal Arabic Dialogues

    Apr 30, 2026Muhammad Dehan Al Kautsar, Saeed Almheiri, Momina Ahsan +13Multilingual Language Model EvaluationArabic NLP