Language Model Generation Evaluation

Latest papers 209

All topics
CardsList
  1. Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation

    Jun 1, 2026Junjie Chen, Yuxi Dong, Haitao Li +5LLM EvaluationLLM-as-a-Judge

  2. Child-directed speech facilitates production, not comprehension, in BabyLMs

    May 31, 2026Bastian Bunzeck, Sina ZarrießLanguage Model PretrainingLLM Evaluation

  3. Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks

    May 30, 2026Yongxi Zhou, Lai Yun Choi, Jiaxi Wen +1LLM EvaluationLanguage Model Generation Evaluation

  4. BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali

    May 29, 2026Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham +3Multilingual Language Model EvaluationLanguage Model Error Detection

  5. TSM-Bench: Detecting LLM-Generated Text in Real-World Wikipedia Editing Practices

    May 29, 2026Gerrit Quaremba, Elizabeth Black, Denny Vrandečić +1AI-Generated Text DetectionLanguage Model Generation Evaluation

  6. Fine-Tuning Improves Information Conveyance in Language Models

    May 29, 2026Yuwei Cheng, Weiyi Tian, Haifeng XuLanguage Model Generation EvaluationLLM Fine-Tuning

  7. Generating and Refining Dynamic Evaluation Rubrics for LLM-as-a-Judge

    May 28, 2026Zijie Wang, Eduardo BlancoLLM-as-a-JudgeLanguage Model Generation Evaluation

  8. SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?

    May 28, 2026Jiamin Chen, Yidi Wu, Qiexiang Wang +6LLM EvaluationLLM-as-a-Judge

  9. ExCAM: Explainable Cultural Awareness Metrics

    May 28, 2026Christoph Leiter, Haiyue Song, Hour Kaing +4LLM EvaluationLanguage Model Generation Evaluation

  10. Personalized Turn-Level User Conversation Satisfaction Benchmark

    May 28, 2026Zhefan Wang, Zhiqiang Guo, Weizhi Ma +3Human Preference EvaluationLLM Personalization

  11. TRACE: Toulmin-based Reasoning Assessment through Constructive Elements for LLM CoT Evaluation

    May 28, 2026Yundong Kim, Heyoung YangLLM EvaluationLanguage Model Generation Evaluation

  12. Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study

    May 27, 2026Irune Zubiaga, Aitor Soroa, Rodrigo AgerriMultilingual Language Model EvaluationLLM-as-a-Judge

  13. Entropy Distribution as a Fingerprint for Hallucinations in Generative Models

    May 27, 2026Mattia J. Villani, Pranav Deshpande, Akshay Seshadri +2Language Model Error DetectionLanguage Model Generation Evaluation

  14. MATCHA: Matching Text via Contrastive Semantic Alignment

    May 26, 2026Siran Li, Ece Sena Etoglu, Carsten Eickhoff +1LLM EvaluationSemantic Textual Similarity

  15. Plans for Evaluating Structured Generative Search Summaries

    May 26, 2026Tetsuya Sakai, Jina Lee, Hanpei Fang +1Language Model Generation EvaluationSummarization Evaluation

  16. Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why

    May 25, 2026Delip Rao, Chris Callison-BurchInter-Rater ReliabilityLLM Evaluation

  17. Faithfulness Metrics Don't Measure Faithfulness: A Meta-Evaluation with Ground Truth

    May 24, 2026Yoav Gur-Arieh, Ana Marasović, Mor GevaCoT FaithfulnessLLM Evaluation

  18. NLG Evaluation: Past, Present, Future

    May 22, 2026Ehud ReiterLLM EvaluationLanguage Model Generation Evaluation

  19. How Human-Like Are Large Language Models? A Register-Aware Linguistic Evaluation Framework

    May 22, 2026Björn Nieth, Marianna Gracheva, Michaela Mahlberg +2LLM EvaluationLanguage Model Generation Evaluation

  20. RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator

    May 20, 2026Zhenwei Tang, Zhaoyan Liu, Rasa Hosseinzadeh +3LLM EvaluationPairwise Comparison

  21. APM: Evaluating Style Personalization in LLMs with Arbitrary Preference Mappings

    May 20, 2026Philipp Spohn, Leander Girrbach, Zeynep AkataLLM EvaluationLLM Personalization

  22. Less Back-and-Forth: A Comparative Study of Structured Prompting

    May 19, 2026Saurav Ghosh, Gabriella Polach, Abdou SowLLM EvaluationStructured Prompting

  23. LP-Eval: Rubric and Dataset for Measuring the Quality of Legal Proposition Generation

    May 19, 2026Shanshan Xu, Johan Lindholm, Amogh Raina +2Legal NLPLLM Evaluation

  24. Base Models Look Human To AI Detectors

    May 19, 2026Yixuan Even Xu, Ziqian Zhong, Aditi Raghunathan +2AI-Generated Text DetectionLanguage Model Generation Evaluation