Language Model Generation Evaluation

Latest papers 209

All topics
CardsList
  1. ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals

    Sep 15, 2026Bowen Qin, Yi Xie, Yesheng Liu +1Reward HackingLanguage Model Generation Evaluation

  2. YallaMorph: A Benchmark for Evaluating Arabic Morphological Generation in Large Language Models

    Sep 9, 2026Mahmoud Reda, Salam Khalifa, Reham Marzouk +1Multilingual Language Model EvaluationArabic NLP

  3. API Benchmark Scores Do Not Reliably Transfer to Chatbot Interfaces

    Sep 8, 2026Jennifer Wang, Joachim Baumann, Daniel E. Ho +1LLM EvaluationLanguage Model Generation Evaluation

  4. How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation

    Sep 1, 2026Elitsa Yotkova, Violeta Kastreva, Petar Velkov +4LLM Answer VerificationLanguage Model Generation Evaluation

  5. Does task decomposition improve automatic NLG evaluation?

    Sep 1, 2026Sebastian Steindl, Nikos Voskarides, Alberto Gasparin +1LLM EvaluationLLM-as-a-Judge

  6. Value Over Language Model: Detecting Original Contribution in Writing

    Sep 1, 2026Vibhhu Sharma, Thorsten Joachims, Sarah DeanLLM EvaluationAI-Generated Text Detection

  7. CLIN: an Objective Framework for Evaluating Creativity in Short Persian Literary Text

    Aug 31, 2026Mohammad Reza Modarres, Armin Tourajmehr, Yadollah Yaghoobzadeh +1Creativity AssessmentLLM Evaluation

  8. Small Language Models as Judges for Rubric-Based Reinforcement Learning

    Aug 30, 2026Fengyu Xie, Yilun Zhao, Bingsen Chen +2LLM-as-a-JudgeLanguage Model Generation Evaluation

  9. IndicDetect: Evaluating Cross-Lingual LLM-Generated Text Detection for Hindi, Telugu, and Tamil

    Aug 30, 2026Bhaskar Ganesh Devalla, Junchao Wu, Nilesh Dokuparthi +4AI-Generated Text DetectionLanguage Model Generation Evaluation

  10. GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation

    Aug 30, 2026Yifan Chen, Haitao Li, Qingyao Ai +4LLM-as-a-JudgeLanguage Model Generation Evaluation

  11. Novels generated by language models show compressed formal variation

    Aug 12, 2026Mehdy Sedaghat Payam, Justin QuinnLLM EvaluationLong-Form Document Generation

  12. Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

    Aug 12, 2026Rodrigo Guedes de Souza, Alison R. PanissonLLM EvaluationLanguage Model Generation Evaluation

  13. EVIL-Detect for NLPCC 2026 Shared Task 6: LLM-Generated Text Detection

    Aug 11, 2026Hongrui Bao, Hangyu Rong, Zhuoshang Wang +2AI-Generated Text DetectionLanguage Model Generation Evaluation

  14. Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

    Aug 10, 2026Siyang Wu, Yibo Jiang, Bryon AragamPrompt SensitivityLLM Evaluation

  15. TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

    Aug 10, 2026Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland +13LLM EvaluationAutomated Theorem Proving

  16. AI Evaluation Should Measure Verification Cost, Not Correctness Alone

    Aug 9, 2026Viviana Crescitelli, Generoso Immediato, Fabio Persia +1Language Model Generation EvaluationGenerative AI Evaluation

  17. DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate

    Aug 8, 2026Anthony Miyaguchi, Conor JohnstonLLM EvaluationLLM-as-a-Judge

  18. Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

    Aug 7, 2026Hongyu Luo, He Wang, Huihao Jing +6Creativity AssessmentLLM Evaluation

  19. Where Models Converge and Humans Diverge: A Coverage Framework for Distributional Pluralism in Open-Ended Generation

    Aug 6, 2026Zini Yang, Emily Wenger, Richard SoOpen-Ended GenerationLLM Evaluation

  20. What We Observe as LLM Behavior Can Be a Side-effect of Inference Backend

    Aug 5, 2026Shahed Masoudian, Passant Shafaei, Monorama Swain +1LLM EvaluationLanguage Model Generation Evaluation

  21. Kathleen Writes: Autoregressive Generation and Data Scaling Without Attention

    Aug 5, 2026George FountzoulasLanguage Model Generation EvaluationAutoregressive Language Modeling

  22. Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics

    Aug 2, 2026Shengwei Xu, Yuxuan Lu, Yifan Wu +2Language Model Generation EvaluationAutomated Evaluation

  23. CraftAlign: Feature-Grounded Evaluation and Revision Guidance for AI Stories

    Aug 2, 2026Yang Yang, Boyun Xu, Shaofeng Liang +5AI-Generated Text DetectionLanguage Model Generation Evaluation

  24. ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models

    Jul 31, 2026Penglin Zhu, Jungang XuLLM EvaluationPairwise Comparison