LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. A dataset of rated conceptual arguments

    Jul 29, 2026Emery Cooper, Caspar Oesterheld, Linh Chi Nguyen +2LLM Evaluation

  2. Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models

    Jul 29, 2026Parishruthi Ganesh, Gerry Dozier, Cheryl SealsLLM EvaluationZero-Shot Text Classification

  3. Dimensionality and Measurement Precision in HLE's Multiple-Choice Subset

    Jul 29, 2026Mayank Sharma, Savira Nadela, Tyler MattesonLLM EvaluationPsychometric Validation

  4. APEX-Accounting

    Jul 29, 2026Julien Benchek, Austin Bennett, Jasmin Kern +8LLM EvaluationBusiness Process Automation

  5. BayesAME: Bayesian Active Model Evaluation

    Jul 29, 2026Paula Cordero Encinar, Taylan Cemgil, Arnaud Doucet +2LLM EvaluationAdaptive Sampling

  6. ForgetBench: Benchmarking Forgetting Dynamics of Long-Term Parametric Memory in Language Models

    Jul 29, 2026Ruxi Gu, Zhenliang Zhang, Wei WangKnowledge EditingContinual Learning for LLMs

  7. Knowledge before Reasoning: EC-Reason-Bench, a Training-Free Diagnostic Benchmark for LLM Enzyme Classification

    Jul 29, 2026Linyu Li, Zhi Jin, Yichi Zhang +6Retrieval-Augmented GenerationLLM Evaluation

  8. When Synthetic Users Fail: A Cross-Domain Benchmark of LLM-Simulated Human Survey Responses

    Jul 28, 2026Zihan Chen, Di Zhu, Lei Nico ZhengLLM EvaluationLarge Language Model-Based Social Simulation

  9. Position: Evaluation Scores Are Perishable Knowledge Claims

    Jul 28, 2026Sankalp Gilda, Shlok GildaLLM EvaluationLLM Reliability

  10. Evaluating Communicative Belief Updates in Large Language Models via Implicature Recognition and Cancellation

    Jul 27, 2026Cesare Spinoso-Di Piano, Verna Dankers, Marius Mosbach +1LLM EvaluationPragmatic Reasoning in Language Models

  11. CogArena: A Multimethod Evaluation of Cognitive Ability Structure in Large Language Models

    Jul 27, 2026Dengzhe Hou, Lingyu Jiang, Fangzhou Lin +1LLM EvaluationCognitive Modeling

  12. Preliminary Guidelines for Using and Evaluating GenAI Tools to Support Systematic Literature Reviews

    Jul 27, 2026Barbara Kitchenham, Sebastián Pizard, Lech Madeyski +3LLM EvaluationHuman-in-the-Loop Evaluation

  13. LLM-SoccerArena: Benchmarking LLMs on Real-World Predictions in Sports

    Jul 27, 2026Jonas Schröder, Jonas Schweisthal, Oliver Müller +2LLM EvaluationForecasting Benchmarks

  14. Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets

    Jul 27, 2026Zongyou Yang, Yinghan HouLLM EvaluationLLM Answer Verification

  15. Understanding Tone-Dependent Inference Cost in Large Language Models

    Jul 27, 2026Akhil Kumar, Om DobariyaLLM Inference EfficiencyLLM Evaluation

  16. How Context Attribution Handles What the Model Already Knows

    Jul 26, 2026Quoc-Huy Trinh, Lin Zhu, Sebastian SzyllerLLM EvaluationLLM Interpretability

  17. Zing: Social Mind for LLMs

    Jul 26, 2026Zing Team, Ao Xiang, Bi Jingping +56LLM EvaluationLLM Grounding

  18. Do Diagrams Help Large Language Models Reason? Evidence from Syllogistic Reasoning

    Jul 26, 2026Risako Ando, Koji MineshimaLLM EvaluationLLM Reasoning

  19. Reasoning or Memorization: Can LLMs Understand and Generate Chinese Xiehouyu Riddles?

    Jul 26, 2026Hai Hu, Siyuan Song, Chongtian Shao +3LLM EvaluationMemorization in Language Models

  20. TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation

    Jul 26, 2026Arslan Bisharat, Eric Spencer, Brian Ortiz +8LLM EvaluationFormal Verification

  21. BERT-based Models vs. Large Language Models for Low-Resource Named Entity Recognition: A Comparative Study on Marathi

    Jul 25, 2026Hariom Ingle, Ronit Ghode, Ishwari Gondkar +2Named Entity RecognitionLLM Evaluation

  22. Guarantees on Dynamical System Distinguishability for LLM Token Generation

    Jul 25, 2026Mohamed Akrout, Dan WilsonLLM EvaluationClassification