LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. ASCIIBench: Evaluating Language-Model-Based Understanding of Visually-Oriented Text

    Dec 2, 2025Kerry Luo, Michael Fu, Joshua Peguero +6VLM EvaluationLLM Evaluation

  2. A Comparative Study of Student Perspectives on Technical Writing Feedback Quality: Evaluating LLMs, SLMs, and Humans in Computer Science Topics

    Dec 1, 2025Suqing Liu, Runlong Ye, Christopher Eaton +2LLM EvaluationComputer Science Education

  3. ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

    Nov 28, 2025Šimon Sedláček, Sara Barahona, Bolaji Yusuf +9Audio-Language Model EvaluationLLM Evaluation

  4. Large language models replicate and predict human cooperation across experiments in game theory

    Nov 6, 2025Andrea Cera Palatsi, Samuel Martin-Gutierrez, Ana S. Cardenal +1LLM EvaluationGame Theory

  5. Sequential Bayesian Evaluation of Large Language Model Behavior

    Nov 4, 2025Saatvik Kher, Shang Wu, Rachel Longjohn +2LLM EvaluationLanguage Model Generation Evaluation

  6. Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities

    Nov 4, 2025Amanda Bertsch, Adithya Pratapa, Teruko Mitamura +2LLM EvaluationLong-Context Language Model Evaluation

  7. A Quantitative Study of Sustained Focus in Large Language Models via Repetitive Deterministic Prediction Tasks

    Nov 2, 2025Wanda Hou, Leon Zhou, Hong-Ye Hu +3LLM EvaluationLLM Reliability

  8. Idea2Plan: Exploring AI-Powered Research Planning

    Oct 28, 2025Jin Huang, Silviu Cucerzan, Sujay Kumar Jauhar +1LLM EvaluationLLM-as-a-Judge

  9. Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)

    Oct 27, 2025Liwei Jiang, Yuanjun Chai, Margaret Li +7Open-Ended GenerationLLM Evaluation

  10. Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks

    Oct 26, 2025Peiyu Li, Xiuxiu Tang, Si Chen +4LLM EvaluationPsychometric Validation

  11. User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios

    Oct 23, 2025Xiaoyuan Wu, Roshni Kaushik, Wenkai Li +2LLM EvaluationLLM-as-a-Judge

  12. CreativityPrism: A Cross-Domain Evaluation Framework for Large Language Model Creativity

    Oct 23, 2025Zhaoyi Joey Hou, Bowei Alvin Zhang, Yining Lu +9Creativity AssessmentLLM Evaluation

  13. BuildArena: A Physics-Aligned Interactive Benchmark of LLMs for Engineering Construction

    Oct 18, 2025Tian Xia, Tianrun Gao, Wenhao Deng +4LLM EvaluationLLM Grounding

  14. LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?

    Oct 10, 2025Kaijian Zou, Aaron Xiong, Yunxiang Zhang +6LLM EvaluationCompetitive Programming

  15. StatEval: A Comprehensive Benchmark for Large Language Models in Statistics

    Oct 10, 2025Yuchen Lu, Run Yang, Yichen Zhang +6LLM EvaluationReasoning Evaluation

  16. Large Language Model Selection with Limited Annotations

    Oct 10, 2025Yavuz Durmazkeser, Patrik Okanovic, Andreas Kirsch +2Model SelectionLLM Evaluation

  17. What and Whose Knowledge? Measuring Epistemic Diversity in Large Language Models

    Oct 5, 2025Dustin Wright, Sarah Masud, Jared Moore +5LLM EvaluationCultural Bias in Language Models

  18. Uncovering the Computational Ingredients of Human-Like Representations in LLMs

    Oct 1, 2025Zach Studdiford, Timothy T. Rogers, Kushin Mukherjee +1LLM EvaluationLLM Fine-Tuning

  19. Rethinking Reward Models for Multi-Domain Test-Time Scaling

    Oct 1, 2025Dong Bok Lee, Seanie Lee, Sangwoo Park +12Reward ModelingLLM Evaluation

  20. Predicting Effects, Missing Distributions: Evaluating LLMs as Human Behavior Simulators in Operations Management

    Sep 30, 2025Runze Zhang, Xiaowei Zhang, Mingyang ZhaoLLM EvaluationHuman Behavior Simulation

  21. Predicting LLM Reasoning Performance with Small Proxy Model

    Sep 25, 2025Woosung Koh, Juyoung Suk, Sungjun Han +2Language Model PretrainingLLM Evaluation

  22. Polarity Detection of Sustainable Development Goals in News Text

    Sep 24, 2025Andrea Cadeddu, Alessandro Chessa, Vincenzo De Leo +5LLM EvaluationSentiment Analysis

  23. Clotho: Measuring Task-Specific Pre-Generation Test Adequacy for LLM Inputs

    Sep 22, 2025Juyeon Yoon, Somin Kim, Robert Feldt +1LLM EvaluationLLM Reliability

  24. LLMs and their Limited Theory of Mind: Evaluating Mental State Annotations in Situated Dialogue

    Sep 2, 2025Katharine Kowalyshyn, Matthias ScheutzLLM EvaluationTheory of Mind