LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Assessing AI in Introductory Physics Problem Solving

    Jul 15, 2026Amir Bralin, N. Sanjay RebelloLLM EvaluationMultimodal Large Language Models

  2. Hindcast: Replaying Prediction Markets to Evaluate LLM Forecasters

    Jul 15, 2026Xiao Ye, Jacob Dineen, Evan Zhu +3LLM EvaluationForecasting Benchmarks

  3. Pezego-HITL: A policy-grounded large language model architecture for agricultural extension in Ghana

    Jul 15, 2026Shunbao Li, Zhipeng Yuan, Amoako Ofori +5Retrieval-Augmented GenerationLLM Evaluation

  4. Rating the Raters: Rasch Measurement Theory for LLM Evaluation

    Jul 14, 2026Pratik S. Sachdeva, Nathan BoudolLLM EvaluationLLM-as-a-Judge

  5. LLM Judges Can Be Too Generous When There Is No Reference Answer

    Jul 14, 2026Chalamalasetti Kranti, Sowmya VajjalaLLM EvaluationLLM-as-a-Judge

  6. Can LLMs Write Reliable Rubrics? A Meta-Evaluation for Experiment Reproduction

    Jul 14, 2026Hanhua Hong, Yizhi Li, Jiaoyan Chen +4LLM EvaluationRubric-Based Evaluation

  7. Epistemic Stance Flexibility Probing: Measuring Prompt-Conditioned Register Shift in Large Language Models

    Jul 14, 2026Binwen Liu, Yilin RenLLM EvaluationPragmatic Reasoning in Language Models

  8. LLMs Can See the Smoke but not the Fire: Evaluating Abductive Reasoning with Elenchos

    Jul 14, 2026Julius Steiglechner, Lucas Mahler, Gabriele LohmannLLM EvaluationLLM Reasoning

  9. Extractable Memorization From First Principles

    Jul 14, 2026A. Feder Cooper, Marika Swanberg, Jamie Hayes +5LLM EvaluationMemorization in Language Models

  10. Comparing Semantic Navigation in Humans and Large Language Models using Natural Language Processing

    Jul 13, 2026Gabriel Paris-Colombo, Rodrigo M. Cabral-Carvalho, Felipe D. Toro-HernándezLLM Evaluation

  11. Can LLMs Perform Technical Comprehension of Computer Architecture Papers?

    Jul 13, 2026Nishant Aggarwal, Aishwarya Lekshmi Chithra, Ayushi Dubal +8Document UnderstandingLLM Evaluation

  12. What We Talk About When We Talk About LLM Planning: Evidence for Two Distinct Planning Abilities

    Jul 13, 2026Sukai Huang, Chenyuan Zhang, Fucai Ke +4LLM EvaluationLLM Planning

  13. Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists

    Jul 13, 2026Chuhan Shi, Xiaoquan Ren, Sicheng Song +3AI for ScienceLLM Evaluation

  14. The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese

    Jul 12, 2026Siyuan Song, Zhiheng Qian, Yunhao Zhang +11Language Model PretrainingLLM Evaluation

  15. CRiT-QA: Evaluating Multi-hop Reasoning with Counterfactual Chains and Distractor Traps

    Jul 12, 2026JungMin Yun, JuneHyoung Kwon, YoungBin KimMulti-Hop QALLM Evaluation

  16. Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness

    Jul 11, 2026Hong-In Won, Jinseok Jang, Hyoseop KimLLM EvaluationMoral Reasoning in Language Models

  17. Mirror Horizon: Viable Path Entropy as a Measure of Bounded Reflection

    Jul 11, 2026Tiantian ZhangLLM Evaluation

  18. Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts

    Jul 10, 2026Renuka Oladri, Mohan Vamsi Varadaraju Priya, Jerry WuLLM QuantizationLLM Evaluation

  19. Attention to Detail: Evaluating Energy, Performance, and Accuracy Trade-offs Across vLLM Configurations

    Jul 10, 2026Nada Zine, Tristan Coignion, Vincenzo Stoico +3LLM Inference EfficiencyLLM Evaluation

  20. NL-PAC: Specification Ambiguity and Certified Minimax Risk Floors in LLM-Mediated Supervision

    Jul 9, 2026Berkay AnahtarciLLM EvaluationPartial Identification

  21. The Illusion of Equivalency: Statistical Characterization of Quantization Effects in LLMs

    Jul 9, 2026Baha Rababah, Cuneyt Gurcan Akcora, Carson K. LeungLLM EvaluationPost-Training Quantization