Language Model Generation Evaluation

Latest papers 209

All topics
CardsList
  1. CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation

    Jul 31, 2026Mengting Chen, Yanshu Sun, Wanting Liang +5Open-Ended GenerationLLM Evaluation

  2. Beyond a Single Judge: The Evidence-Grounded, Social-Weighted Persona Panel for Generative UI Evaluation

    Jul 30, 2026Zheng Wu, Yibo Luo, Pu Zhang +2Human Preference EvaluationLLM-as-a-Judge

  3. Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets

    Jul 27, 2026Zongyou Yang, Yinghan HouLLM EvaluationLLM Answer Verification

  4. QuantiBias: Benchmarking Quantization-Induced Bias in LLMs

    Jul 23, 2026Emilio FerraraOpen-Ended GenerationLLM Quantization

  5. StabilityBench: Benchmarking Instability in LLMs

    Jul 17, 2026Emma Kondrup, Zachary Yang, Anne Imouza +1LLM EvaluationLanguage Model Generation Evaluation

  6. BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services

    Jul 13, 2026Yuzhe Guo, Mengzhou Wu, Yuan Cao +4Tool-Augmented Language Model AgentsLanguage Model Generation Evaluation

  7. Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging

    Jul 11, 2026Jinglan Gong, Jiefan Lu, Hewei Guo +5Language Model Generation EvaluationPersona Consistency

  8. Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation

    Jul 6, 2026Sadia Kamal, Arefa Patwary, Anthony Marchiafava +2LLM EvaluationLanguage Model Generation Evaluation

  9. SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models

    Jul 6, 2026Thomas Thebaud, Yuzhe Wang, Hao Zhang +5Audio-Language Model EvaluationLanguage Model Generation Evaluation

  10. Rating the Pitch, Not the Product: User Evaluations of LLMs Reflect Expectations More Than Performance

    Jul 6, 2026Robert Morabito, Tyler McDonald, Charitra Viswanath +4Human Preference EvaluationLLM Evaluation

  11. Telescope: Improving Zero Shot Detection of LLM Generated Content By Measuring Token Repetition Probability

    Jul 5, 2026Christopher Nassif, Josh F. CooperAI-Generated Text DetectionLanguage Model Generation Evaluation

  12. Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization

    Jul 2, 2026Jan DrchalLLM EvaluationLanguage Model Generation Evaluation

  13. Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling

    Jul 2, 2026Dazhi Fu, Jiuding Yang, Yiwen Guo +1Reward ModelingLLM-as-a-Judge

  14. LitReview Arena: Evaluating Literature Review Agents with Battle-Style Peer Review Platform

    Jul 1, 2026Ruotong Zhao, Zhiyu Chen, Xurui Liu +7Human Preference EvaluationLLM-as-a-Judge

  15. Persona Non Grata: LLM Persona-Driven Generations in MCQA are Unstable in Distinct Dimensions

    Jul 1, 2026César Guerra-Solano, Xiang Lorraine LiLLM EvaluationLanguage Model Generation Evaluation

  16. "Don't Say It!": Constraints, Compliance, and Communication when Language Models Play Taboo

    Jul 1, 2026Sara Candussio, Francesca Padovani, Daniel Scalena +1LLM GroundingLanguage Model Generation Evaluation

  17. SEFORA: Student Essays with Feedback Corpus and LLM Feedback Evaluation Framework

    Jun 30, 2026Shayan Peyghambari Oskoui, Norah Almousa, Zhaoyi Joey Hou +5LLM EvaluationLanguage Model Generation Evaluation

  18. Little Brains, Big Feats: Exploring Compact Language Models

    Jun 29, 2026Dari Baturova, Elena Bruches, Ivan Chernov +3Retrieval-Augmented GenerationOn-Device Language Model Inference

  19. Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

    Jun 29, 2026Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie +2Language Model Generation EvaluationMultimodal Reasoning

  20. Understanding Evaluation Illusion in Diffusion Large Language Models

    Jun 28, 2026Hengxiang Zhang, Jiaxi Ren, Renchunzi Xie +1Prompt SensitivityLLM Evaluation

  21. Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement

    Jun 25, 2026Sangwoo Cho, Kushal Chawla, Pengshan Cai +4LLM EvaluationLLM-as-a-Judge

  22. The Capability Frontier: Benchmarks Miss 82% of Model Performance

    Jun 25, 2026Bradley Fowler, Ryan Smith, Daniel Thi Graviet +8LLM EvaluationLanguage Model Generation Evaluation

  23. DualEval: Joint Model-Item Calibration for Unified LLM Evaluation

    Jun 24, 2026Aaron J. Li, Hao Huang, Youngmin Park +6LLM EvaluationLanguage Model Generation Evaluation

  24. CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression

    Jun 23, 2026Morayo Danielle Adeyemi, Ryan A. Rossi, Franck DernoncourtLLM EvaluationLLM Compression

  25. PRIME: Evaluating Prompt Resolution Under Incompatible Instructions in LLMs

    Jun 21, 2026Tehreem Javed, Shumaim Fatimah, Masooma Bakhtiari +2LLM EvaluationLanguage Model Generation Evaluation

  26. RECOM: A Validity Discrimination Tradeoff in Automatic Metrics for Open Ended Reddit Question Answering

    Jun 17, 2026Pushwitha Krishnappa, Amit Das, Vinija Jain +2Open-Ended GenerationLLM Evaluation

  27. How Inference Compute Shapes Frontier LLM Evaluation

    Jun 16, 2026Jessica McFadyen, Ole Jorgensen, Harry Coppock +2LLM EvaluationLanguage Model Generation Evaluation

  28. Prompt Perturbation for Reliable LLM Evaluation over Comparison Graphs

    Jun 16, 2026Dong Huang, Jianbo Sun, Pengkun YangLLM EvaluationPairwise Comparison

  29. The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

    Jun 16, 2026Rui Wen, Lu Sun, Jiayang Liu +3Open-Ended GenerationLLM Evaluation

  30. Beyond Accuracy: Measuring Bias Acknowledgment in Chain-of-Thought Reasoning for Responsible AI Evaluation

    Jun 13, 2026Xian Sun, Wei Gao, Yingshuo Wang +9Language Model Generation EvaluationCoT Evaluation

  31. Metric Match: A Subset Selection Approach to Evaluating LLM Judge Reliability

    Jun 12, 2026Alyssa Unell, Natalie Dullerud, Naomi Boneh +4LLM-as-a-JudgeLanguage Model Generation Evaluation

  32. GENIE: A Fine-Grained Measure for Novelty

    Jun 11, 2026Ramya Namuduri, Manya Wadhwa, Anshun Asher Zheng +2LLM EvaluationLanguage Model Generation Evaluation

  33. Correct Looks Better: Pairwise Comparisons Reveal Accuracy Rankings

    Jun 8, 2026Mina Remeli, Moritz HardtPairwise ComparisonLLM-as-a-Judge

  34. Can LLMs understand LilyPond? A benchmark for symbolic music generation and understanding

    Jun 7, 2026Matteo Spanio, Mohammad Torabi, Andrea Poltronieri +1Music Generation EvaluationLLM Evaluation

  35. SLMJury: Can Small Language Models Judge as Well as Large Ones?

    Jun 5, 2026Anish Laddha, Nitesh Pradhan, Gaurav SrivastavaLLM-as-a-JudgeLanguage Model Generation Evaluation

  36. Cutting LLM Evaluation Costs with SySRs: A Bandit Algorithm that Provably Exploits Model Similarity

    Jun 5, 2026Zifan Lyu, Chahine Nejma, Tobias Wegel +2Model SelectionMulti-Armed Bandits

  37. Explain Like I'm 5 or Whatever I Choose: Evaluating the Interactive Potential of Language Model Responses

    Jun 5, 2026Indu Panigrahi, Tal AugustLLM EvaluationLanguage Model Generation Evaluation

  38. UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs

    Jun 4, 2026Amirhossein Abaskohi, Amirhossein Dabiriaghdam, Liang Luo +4LLM EvaluationLanguage Model Generation Evaluation

  39. Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement

    Jun 4, 2026Xin Wang, Liangtai Sun, Yaoming Zhu +8Computer-Use Agent BenchmarksLanguage Model Generation Evaluation

  40. Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios

    Jun 4, 2026Tao Liu, Ye Lu, Ruohua Zhang +4LLM EvaluationLLM-as-a-Judge

  41. Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

    Jun 3, 2026XiuYu Zhang, Yi Shan, Junfeng Fang +1LLM EvaluationLLM-as-a-Judge