LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Reversing Arrows in Large Language Models

    Aug 4, 2026Sefika Efeoglu, Adrian PaschkeKG ConstructionLLM Evaluation

  2. Shorter Reasoning, Earlier Answers? An Evaluation of Reasoning Interfaces

    Aug 4, 2026Francesca Carlon, Vincent Ginis, Andres AlgabaLLM EvaluationOverthinking in Language Models

  3. Don't Let Me Ask for It: LLMs Show Deficiencies in Active Multi-Turn Information Acquisition for Abductive Inference

    Aug 4, 2026Shahrukh Mohiuddin, Chalamalasetti Kranti, Sherzod Hakimov +1LLM EvaluationLanguage Model Probing

  4. On the Diversity of Analogy Making in Large Language Models

    Aug 4, 2026Yuanhao Shen, Daniel Xavier de Sousa, Caio César Sifuentes Barcelos +2LLM EvaluationText Generation

  5. Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains

    Aug 4, 2026Yanchao Li, Wanhao Liu, Jiaqing Xie +4LLM EvaluationLLM Auditing

  6. Beyond Accuracy: A Multidimensional Evaluation of Statistical Reasoning in Large Language Models

    Aug 4, 2026Monnie McGee, Mateo Langston Smith, Julian CabreraLLM Evaluation

  7. On the missing benchmarks layer and a potential solution

    Aug 4, 2026Francis F Daniel, Mauro Ibañez, Francis Perelman +1LLM EvaluationBenchmark Auditing

  8. Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores

    Aug 4, 2026Zeyu Zhang, Bradly C. StadieLLM EvaluationLLM Auditing

  9. Mapping the City Through the Lens of Language Models

    Aug 4, 2026Wanqi Liu, Rong Zhao, Zhizhou Sha +2LLM Evaluation

  10. Every Wrong Answer Counts: Option-Level Psychometrics for LLM Multiple-Choice Benchmarks

    Aug 3, 2026Xiao Fei, Yang Zhang, Sarah Almeida Carneiro +1LLM EvaluationPsychometric Validation

  11. onepot-Bench 0: towards lab-aware in silico chemistry benchmarks

    Aug 3, 2026Brandon Wang, Andrei S. Tyrin, Daniil A. BoikoLLM Safety BenchmarksLLM Evaluation

  12. Training-Free versus Training-Based Intent Classification in LLMs: Accuracy, Robustness, and Failure Modes

    Aug 3, 2026Nan Chen, Zhouhao Yang, Soufiane HayouZero-Shot LearningLLM Evaluation

  13. Why Large Language Models Fail at Tabular Prediction

    Aug 3, 2026Marta Garnelo, Wojciech M. CzarneckiLLM EvaluationTabular Classification

  14. MonitrLLM: A Community-Centered Evaluation Infrastructure for Large Language Models

    Aug 3, 2026Victor Ojewale, Ro Encarnación, Suresh Venkatasubramanian +1LLM EvaluationHuman-in-the-Loop Evaluation

  15. From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution

    Aug 3, 2026Can Wang, Haoran Chen, Haowen Gao +3LLM EvaluationBenchmark Design

  16. How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models

    Aug 3, 2026Andres Algaba, Francesca Carlon, Lynn Delcon +3LLM EvaluationLLM Interpretability

  17. Style Wins, Substance Loses: A Diagnosis of LLM-as-Judge in Idea Generation

    Aug 3, 2026Fengxian Ji, Yuke Li, Jingpu Yang +8LLM EvaluationLLM-as-a-Judge

  18. Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal standard

    Aug 3, 2026Hector Zenil, Luan OzelimLLM EvaluationBayesian Inference

  19. Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models

    Aug 2, 2026Fali Wang, Ali Al-Lawati, Iliyas Bektas +5LLM EvaluationLLM Reasoning with Graphs

  20. Language Equality has a Price: A Systematic Investigation of Multi-turn LLM Performance for EU-24+

    Aug 2, 2026Sherzod Hakimov, Karl Osswald, Jelle Psurek +3Multilingual Language Model EvaluationLLM Evaluation

  21. CrossLex: A Source-Grounded Benchmark for Cross-Jurisdictional Legal Reasoning in Large Language Models

    Aug 2, 2026Xiaocui Yang, Xican Tan, Shoujie Chen +3LLM EvaluationLLM Grounding

  22. Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation

    Aug 2, 2026Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego KreutzLLM EvaluationCode Generation