Language Model Generation Evaluation

Latest papers 209

All topics
CardsList
  1. Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation

    Jun 1, 2026Junjie Chen, Yuxi Dong, Haitao Li +5LLM EvaluationLLM-as-a-Judge

  2. Child-directed speech facilitates production, not comprehension, in BabyLMs

    May 31, 2026Bastian Bunzeck, Sina ZarrießLanguage Model PretrainingLLM Evaluation

  3. Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks

    May 30, 2026Yongxi Zhou, Lai Yun Choi, Jiaxi Wen +1LLM EvaluationLanguage Model Generation Evaluation

  4. BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali

    May 29, 2026Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham +3Multilingual Language Model EvaluationLanguage Model Error Detection

  5. TSM-Bench: Detecting LLM-Generated Text in Real-World Wikipedia Editing Practices

    May 29, 2026Gerrit Quaremba, Elizabeth Black, Denny Vrandečić +1AI-Generated Text DetectionLanguage Model Generation Evaluation

  6. Fine-Tuning Improves Information Conveyance in Language Models

    May 29, 2026Yuwei Cheng, Weiyi Tian, Haifeng XuLanguage Model Generation EvaluationLLM Fine-Tuning

  7. Generating and Refining Dynamic Evaluation Rubrics for LLM-as-a-Judge

    May 28, 2026Zijie Wang, Eduardo BlancoLLM-as-a-JudgeLanguage Model Generation Evaluation

  8. SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?

    May 28, 2026Jiamin Chen, Yidi Wu, Qiexiang Wang +6LLM EvaluationLLM-as-a-Judge

  9. ExCAM: Explainable Cultural Awareness Metrics

    May 28, 2026Christoph Leiter, Haiyue Song, Hour Kaing +4LLM EvaluationLanguage Model Generation Evaluation

  10. Personalized Turn-Level User Conversation Satisfaction Benchmark

    May 28, 2026Zhefan Wang, Zhiqiang Guo, Weizhi Ma +3Human Preference EvaluationLLM Personalization

  11. TRACE: Toulmin-based Reasoning Assessment through Constructive Elements for LLM CoT Evaluation

    May 28, 2026Yundong Kim, Heyoung YangLLM EvaluationLanguage Model Generation Evaluation

  12. Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study

    May 27, 2026Irune Zubiaga, Aitor Soroa, Rodrigo AgerriMultilingual Language Model EvaluationLLM-as-a-Judge

  13. Entropy Distribution as a Fingerprint for Hallucinations in Generative Models

    May 27, 2026Mattia J. Villani, Pranav Deshpande, Akshay Seshadri +2Language Model Error DetectionLanguage Model Generation Evaluation

  14. MATCHA: Matching Text via Contrastive Semantic Alignment

    May 26, 2026Siran Li, Ece Sena Etoglu, Carsten Eickhoff +1LLM EvaluationSemantic Textual Similarity

  15. Plans for Evaluating Structured Generative Search Summaries

    May 26, 2026Tetsuya Sakai, Jina Lee, Hanpei Fang +1Language Model Generation EvaluationSummarization Evaluation

  16. Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why

    May 25, 2026Delip Rao, Chris Callison-BurchInter-Rater ReliabilityLLM Evaluation

  17. Faithfulness Metrics Don't Measure Faithfulness: A Meta-Evaluation with Ground Truth

    May 24, 2026Yoav Gur-Arieh, Ana Marasović, Mor GevaCoT FaithfulnessLLM Evaluation

  18. NLG Evaluation: Past, Present, Future

    May 22, 2026Ehud ReiterLLM EvaluationLanguage Model Generation Evaluation

  19. How Human-Like Are Large Language Models? A Register-Aware Linguistic Evaluation Framework

    May 22, 2026Björn Nieth, Marianna Gracheva, Michaela Mahlberg +2LLM EvaluationLanguage Model Generation Evaluation

  20. RankJudge: A Multi-Turn LLM-as-a-Judge Synthetic Benchmark Generator

    May 20, 2026Zhenwei Tang, Zhaoyan Liu, Rasa Hosseinzadeh +3LLM EvaluationPairwise Comparison

  21. APM: Evaluating Style Personalization in LLMs with Arbitrary Preference Mappings

    May 20, 2026Philipp Spohn, Leander Girrbach, Zeynep AkataLLM EvaluationLLM Personalization

  22. Less Back-and-Forth: A Comparative Study of Structured Prompting

    May 19, 2026Saurav Ghosh, Gabriella Polach, Abdou SowLLM EvaluationStructured Prompting

  23. LP-Eval: Rubric and Dataset for Measuring the Quality of Legal Proposition Generation

    May 19, 2026Shanshan Xu, Johan Lindholm, Amogh Raina +2Legal NLPLLM Evaluation

  24. Base Models Look Human To AI Detectors

    May 19, 2026Yixuan Even Xu, Ziqian Zhong, Aditi Raghunathan +2AI-Generated Text DetectionLanguage Model Generation Evaluation

  25. Dimension-Level Intent Fidelity Evaluation for Large Language Models: Evidence from Structured Prompt Ablation

    May 14, 2026GAng PengMultilingual Language Model EvaluationLLM Evaluation

  26. NodeSynth: Socially Aligned Synthetic Data for AI Evaluation

    May 14, 2026Qazi Mamunur Rashid, Xuan Yang, Zhengzhe Yang +5Language Model Generation EvaluationLanguage Model Safety Evaluation

  27. DiffScore: Text Evaluation Beyond Autoregressive Likelihood

    May 12, 2026Wen Lai, Yingli Shen, Dingnan Jin +4LLM EvaluationLanguage Model Generation Evaluation

  28. LLARS: Enabling Domain Expert & Developer Collaboration for LLM Prompting, Generation and Evaluation

    May 11, 2026Philipp Steigerwald, Mara Stieler, Jennifer Burghardt +2Language Model Generation EvaluationLLM Prompting

  29. StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs

    May 11, 2026Pierre Le Jeune, Étienne Duchesne, Weixuan Xiao +4Open-Ended GenerationMultilingual Language Model Evaluation

  30. Active Testing of Large Language Models via Approximate Neyman Allocation

    May 11, 2026Zeli Liu, Jiancheng Zhang, Cong Liu +1LLM EvaluationLanguage Model Generation Evaluation

  31. NARRA-Gym for Evaluating Interactive Narrative Agents

    May 8, 2026Yue Huang, Yuchen Ma, Jiayi Ye +14Language Model Generation EvaluationInteractive Storytelling

  32. Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models

    May 7, 2026Haoxiang Wang, Da Yu, Huishuai ZhangLLM EvaluationLanguage Model Generation Evaluation

  33. Automatically Finding and Validating Unexpected Side-Effects of Interventions on Language Models

    May 6, 2026Quintin Pope, Ajay Hayagreeve Balaji, Jacques Thibodeau +1Language Model Generation EvaluationLLM Auditing

  34. StoryAlign: Evaluating and Training Reward Models for Story Generation

    May 6, 2026Haotian Xia, Hao Peng, Yunjia Qi +4Reward ModelingLanguage Model Generation Evaluation

  35. DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation

    May 6, 2026Bryan Li, William Walden, Yu Hou +6Language Model Generation EvaluationRAG Evaluation

  36. EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

    May 5, 2026Shuyue Stella Li, Rui Xin, Teng Xiao +8RL for Language ModelsLLM Evaluation

  37. Beating the Style Detector: Three Hours of Agentic Research on the AI-Text Arms Race

    May 4, 2026Andreas Maier, Moritz Zaiss, Siming BayerAI-Generated Text DetectionLanguage Model Generation Evaluation

  38. A multilingual hallucination benchmark: MultiWikiQHalluA

    May 4, 2026Freja Thoresen, Dan Saattrup SmartMultilingual Language ModelsMultilingual Language Model Evaluation

  39. Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

    May 2, 2026Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida +6LLM EvaluationLLM-as-a-Judge

  40. From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks

    Apr 30, 2026Qingyu Ren, Tianjun Pan, Xingzhou Chen +1Reward ModelingRL for Language Models

  41. MGTEVAL: An Interactive Platform for Systemtic Evaluation of Machine-Generated Text Detectors

    Apr 28, 2026Yuanfan Li, Qi Zhou, Chengzhengxu Li +5AI-Generated Text DetectionLanguage Model Generation Evaluation

  42. LongSumEval: Question-Answering Based Evaluation and Feedback-Driven Refinement for Long Document Summarization

    Apr 28, 2026Huyen Nguyen, Haoxuan Zhang, Yang Zhang +2Language Model Generation EvaluationFactual Consistency Evaluation

  43. JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems

    Apr 26, 2026Rohith Reddy Bellibatlu, Edward Raff, Wenbin ZhangLLM EvaluationLLM-as-a-Judge