Language Model Generation Evaluation

Latest papers 209

All topics
CardsList
  1. Understanding Evaluation Illusion in Diffusion Large Language Models

    Jun 28, 2026Hengxiang Zhang, Jiaxi Ren, Renchunzi Xie +1Prompt SensitivityLLM Evaluation

  2. Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement

    Jun 25, 2026Sangwoo Cho, Kushal Chawla, Pengshan Cai +4LLM EvaluationLLM-as-a-Judge

  3. The Capability Frontier: Benchmarks Miss 82% of Model Performance

    Jun 25, 2026Bradley Fowler, Ryan Smith, Daniel Thi Graviet +8LLM EvaluationLanguage Model Generation Evaluation

  4. DualEval: Joint Model-Item Calibration for Unified LLM Evaluation

    Jun 24, 2026Aaron J. Li, Hao Huang, Youngmin Park +6LLM EvaluationLanguage Model Generation Evaluation

  5. CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression

    Jun 23, 2026Morayo Danielle Adeyemi, Ryan A. Rossi, Franck DernoncourtLLM EvaluationLLM Compression

  6. PRIME: Evaluating Prompt Resolution Under Incompatible Instructions in LLMs

    Jun 21, 2026Tehreem Javed, Shumaim Fatimah, Masooma Bakhtiari +2LLM EvaluationLanguage Model Generation Evaluation

  7. RECOM: A Validity Discrimination Tradeoff in Automatic Metrics for Open Ended Reddit Question Answering

    Jun 17, 2026Pushwitha Krishnappa, Amit Das, Vinija Jain +2Open-Ended GenerationLLM Evaluation

  8. How Inference Compute Shapes Frontier LLM Evaluation

    Jun 16, 2026Jessica McFadyen, Ole Jorgensen, Harry Coppock +2LLM EvaluationLanguage Model Generation Evaluation

  9. Prompt Perturbation for Reliable LLM Evaluation over Comparison Graphs

    Jun 16, 2026Dong Huang, Jianbo Sun, Pengkun YangLLM EvaluationPairwise Comparison

  10. The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

    Jun 16, 2026Rui Wen, Lu Sun, Jiayang Liu +3Open-Ended GenerationLLM Evaluation

  11. Beyond Accuracy: Measuring Bias Acknowledgment in Chain-of-Thought Reasoning for Responsible AI Evaluation

    Jun 13, 2026Xian Sun, Wei Gao, Yingshuo Wang +9Language Model Generation EvaluationCoT Evaluation

  12. Metric Match: A Subset Selection Approach to Evaluating LLM Judge Reliability

    Jun 12, 2026Alyssa Unell, Natalie Dullerud, Naomi Boneh +4LLM-as-a-JudgeLanguage Model Generation Evaluation

  13. GENIE: A Fine-Grained Measure for Novelty

    Jun 11, 2026Ramya Namuduri, Manya Wadhwa, Anshun Asher Zheng +2LLM EvaluationLanguage Model Generation Evaluation

  14. Correct Looks Better: Pairwise Comparisons Reveal Accuracy Rankings

    Jun 8, 2026Mina Remeli, Moritz HardtPairwise ComparisonLLM-as-a-Judge

  15. Can LLMs understand LilyPond? A benchmark for symbolic music generation and understanding

    Jun 7, 2026Matteo Spanio, Mohammad Torabi, Andrea Poltronieri +1Music Generation EvaluationLLM Evaluation

  16. SLMJury: Can Small Language Models Judge as Well as Large Ones?

    Jun 5, 2026Anish Laddha, Nitesh Pradhan, Gaurav SrivastavaLLM-as-a-JudgeLanguage Model Generation Evaluation

  17. Cutting LLM Evaluation Costs with SySRs: A Bandit Algorithm that Provably Exploits Model Similarity

    Jun 5, 2026Zifan Lyu, Chahine Nejma, Tobias Wegel +2Model SelectionMulti-Armed Bandits

  18. Explain Like I'm 5 or Whatever I Choose: Evaluating the Interactive Potential of Language Model Responses

    Jun 5, 2026Indu Panigrahi, Tal AugustLLM EvaluationLanguage Model Generation Evaluation

  19. UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs

    Jun 4, 2026Amirhossein Abaskohi, Amirhossein Dabiriaghdam, Liang Luo +4LLM EvaluationLanguage Model Generation Evaluation

  20. Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement

    Jun 4, 2026Xin Wang, Liangtai Sun, Yaoming Zhu +8Computer-Use Agent BenchmarksLanguage Model Generation Evaluation

  21. Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios

    Jun 4, 2026Tao Liu, Ye Lu, Ruohua Zhang +4LLM EvaluationLLM-as-a-Judge

  22. Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

    Jun 3, 2026XiuYu Zhang, Yi Shan, Junfeng Fang +1LLM EvaluationLLM-as-a-Judge