Language Model Generation Evaluation

Latest papers 206

All topics
CardsList
  1. Document-Level Text Simplification in Estonian Using Large Language Models

    Oct 7, 2026Meeri-Ly Muru, Eduard BarbuLow-Resource Language ProcessingLanguage Model Generation Evaluation

  2. What pass@k Cannot Measure: Evaluating Diversity and Capability Retention after Post-Training

    Oct 5, 2026Subham Rath, Raj Dandekar, Rajat Dandekar +1LLM EvaluationLanguage Model Generation Evaluation

  3. SOL: Measuring Gaps between Text Distributions by Double Sliced Wasserstein Metrics

    Oct 5, 2026Gregor Kornhardt, Moritz Piening, Jannis Chemseddine +1Non-Autoregressive Text GenerationLanguage Model Generation Evaluation

  4. Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs

    Oct 1, 2026Nagham Omar, Mahmoud Jabarin, Maya Rozenshtein +3Prompt SensitivityLLM Evaluation

  5. Beyond Leaderboards: Tokenomics of Agentic Small Language Model Ensembles

    Oct 1, 2026Alexei N. Skurikhin, Emily M. Taylor, Nathan A. DeBardelebenLLM Inference EfficiencyLanguage Model Generation Evaluation

  6. LLM-as-a-Judge for Low-Resource Languages: Adapting Ragas and Comparative Ranking for Romanian

    Sep 30, 2026Claudiu Creanga, Liviu P. DinuLLM EvaluationLLM-as-a-Judge

  7. Mubric: Mutation Testing-Guided Rubric Generation for LLM Evaluation

    Sep 29, 2026Jiayuxuan Yang, Jie M. Zhang, Yiling Lou +1Language Model Generation EvaluationRubric-Based Evaluation

  8. Dating the Model: Hidden Dates in System Prompts Affect LLM Evaluation

    Sep 29, 2026Mario Sanz-Guerrero, Minh Duc Bui, Manuel Mager +1LLM EvaluationLanguage Model Generation Evaluation

  9. Generating Edit-Inducing Questions for AI Research Manuscripts

    Sep 29, 2026Sebastian Joseph, Zichao Wang, Jennifer Healey +3Text GenerationLanguage Model Generation Evaluation

  10. Coherence-Aware Distributional Evaluation of Open-Ended Text Generation

    Sep 28, 2026Jinnuo Liu, Junhao Zhu, Weifeng Jiang +2Language Model Generation EvaluationGenerative AI Evaluation

  11. MISHAP-Bench: A Hallucination Benchmark for Large Audio-Language Models

    Sep 27, 2026Zhi Wen Soi, Giulio Segalini, Jian-Jia Chen +1Audio-Language Model EvaluationAudio-Language Model Hallucination Detection

  12. Knowing Is Not Choosing: What Explicit Verification Adds Beyond Generative Preference

    Sep 27, 2026Yilong Li, Chengpo Yan, Aayan Arish +1LLM EvaluationLLM Answer Verification

  13. Two Emojis of Difference: What Multilingual Affective Generation Benchmarks Actually Measure

    Sep 24, 2026Fardeen Sadab, Adib SakhawatMultilingual Language Model EvaluationLanguage Model Generation Evaluation

  14. Likelihood Ranking doesn't Scale Like Prompting in LLMs

    Sep 24, 2026Alessandro Bondielli, Lucia Passaro, Davide Bacciu +1LLM EvaluationLanguage Model Generation Evaluation

  15. Reference-Based Analysis of Coherence and Diversity in Open-Ended Text Generation

    Sep 23, 2026Esteban Garcés AriasOpen-Ended GenerationLanguage Model Generation Evaluation

  16. Speculative Evaluation of Stochastic LLMs

    Sep 23, 2026Qianli Shen, Xiang Li, Ruomeng Ding +3LLM EvaluationLanguage Model Generation Evaluation

  17. Recognized but Not Produced: A Generation Benchmark for Culturally Specific Kinship Terms

    Sep 22, 2026Sahil Pardasani, Madhusudan SinghMultilingual Language Model EvaluationLanguage Model Generation Evaluation

  18. JEV-as-a-Judge: Accept When Confident, Escalate When Unsure

    Sep 22, 2026Yubo Li, Yidi Miao, Ramayya Krishnan +1LLM-as-a-JudgeLanguage Model Generation Evaluation

  19. Efficient Cost-Aware LLM Evaluation via Bayesian Bandit Gittins Indices

    Sep 22, 2026Qian Xie, Yueli He, Nairen CaoMulti-Armed BanditsLLM Evaluation

  20. Made in Hungary: Comments on the performance of generative language models

    Sep 16, 2026Mátyás Osváth, Enikő Héja, Noémi Ligeti-NagyLLM EvaluationLanguage Model Generation Evaluation

  21. A Calibrated Instrument for Measuring How Inference Optimizations Affect Output Quality

    Sep 16, 2026Jerry KaplanLLM QuantizationLLM Evaluation

  22. ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals

    Sep 15, 2026Bowen Qin, Yi Xie, Yesheng Liu +1Reward HackingLanguage Model Generation Evaluation

  23. YallaMorph: A Benchmark for Evaluating Arabic Morphological Generation in Large Language Models

    Sep 9, 2026Mahmoud Reda, Salam Khalifa, Reham Marzouk +1Multilingual Language Model EvaluationArabic NLP

  24. API Benchmark Scores Do Not Reliably Transfer to Chatbot Interfaces

    Sep 8, 2026Jennifer Wang, Joachim Baumann, Daniel E. Ho +1LLM EvaluationLanguage Model Generation Evaluation

  25. How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation

    Sep 1, 2026Elitsa Yotkova, Violeta Kastreva, Petar Velkov +4LLM Answer VerificationLanguage Model Generation Evaluation

  26. Does task decomposition improve automatic NLG evaluation?

    Sep 1, 2026Sebastian Steindl, Nikos Voskarides, Alberto Gasparin +1LLM EvaluationLLM-as-a-Judge

  27. Value Over Language Model: Detecting Original Contribution in Writing

    Sep 1, 2026Vibhhu Sharma, Thorsten Joachims, Sarah DeanLLM EvaluationAI-Generated Text Detection

  28. CLIN: an Objective Framework for Evaluating Creativity in Short Persian Literary Text

    Aug 31, 2026Mohammad Reza Modarres, Armin Tourajmehr, Yadollah Yaghoobzadeh +1Creativity AssessmentLLM Evaluation

  29. Small Language Models as Judges for Rubric-Based Reinforcement Learning

    Aug 30, 2026Fengyu Xie, Yilun Zhao, Bingsen Chen +2LLM-as-a-JudgeLanguage Model Generation Evaluation

  30. IndicDetect: Evaluating Cross-Lingual LLM-Generated Text Detection for Hindi, Telugu, and Tamil

    Aug 30, 2026Bhaskar Ganesh Devalla, Junchao Wu, Nilesh Dokuparthi +4AI-Generated Text DetectionLanguage Model Generation Evaluation

  31. GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation

    Aug 30, 2026Yifan Chen, Haitao Li, Qingyao Ai +4LLM-as-a-JudgeLanguage Model Generation Evaluation

  32. Novels generated by language models show compressed formal variation

    Aug 12, 2026Mehdy Sedaghat Payam, Justin QuinnLLM EvaluationLong-Form Document Generation

  33. Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

    Aug 12, 2026Rodrigo Guedes de Souza, Alison R. PanissonLLM EvaluationLanguage Model Generation Evaluation

  34. EVIL-Detect for NLPCC 2026 Shared Task 6: LLM-Generated Text Detection

    Aug 11, 2026Hongrui Bao, Hangyu Rong, Zhuoshang Wang +2AI-Generated Text DetectionLanguage Model Generation Evaluation

  35. Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

    Aug 10, 2026Siyang Wu, Yibo Jiang, Bryon AragamPrompt SensitivityLLM Evaluation

  36. TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

    Aug 10, 2026Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland +13LLM EvaluationAutomated Theorem Proving

  37. AI Evaluation Should Measure Verification Cost, Not Correctness Alone

    Aug 9, 2026Viviana Crescitelli, Generoso Immediato, Fabio Persia +1Language Model Generation EvaluationGenerative AI Evaluation

  38. DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate

    Aug 8, 2026Anthony Miyaguchi, Conor JohnstonLLM EvaluationLLM-as-a-Judge

  39. Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

    Aug 7, 2026Hongyu Luo, He Wang, Huihao Jing +6Creativity AssessmentLLM Evaluation

  40. Where Models Converge and Humans Diverge: A Coverage Framework for Distributional Pluralism in Open-Ended Generation

    Aug 6, 2026Zini Yang, Emily Wenger, Richard SoOpen-Ended GenerationLLM Evaluation

  41. What We Observe as LLM Behavior Can Be a Side-effect of Inference Backend

    Aug 5, 2026Shahed Masoudian, Passant Shafaei, Monorama Swain +1LLM EvaluationLanguage Model Generation Evaluation

  42. Kathleen Writes: Autoregressive Generation and Data Scaling Without Attention

    Aug 5, 2026George FountzoulasLanguage Model Generation EvaluationAutoregressive Language Modeling

  43. Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics

    Aug 2, 2026Shengwei Xu, Yuxuan Lu, Yifan Wu +2Language Model Generation EvaluationAutomated Evaluation

  44. CraftAlign: Feature-Grounded Evaluation and Revision Guidance for AI Stories

    Aug 2, 2026Yang Yang, Boyun Xu, Shaofeng Liang +5AI-Generated Text DetectionLanguage Model Generation Evaluation

  45. ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models

    Jul 31, 2026Penglin Zhu, Jungang XuLLM EvaluationPairwise Comparison