LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. AI Cartography: Mapping the Latent Landscape of AI Benchmark Ecosystems

    May 24, 2026Michael Hardy, Anka Reuel, Lijin Zhang +6LLM EvaluationBenchmark Design

  2. FrontierOR: Benchmarking LLMs' Capacity for Efficient Algorithm Design in Large-Scale Optimization

    May 24, 2026Minwei Kong, Chonghe Jiang, Ao Qu +24LLM EvaluationLarge Language Model-Guided Optimization

  3. JudgmentBench: Comparing Rubric and Preference Evaluation for Quality Assessment

    May 24, 2026Russell Yang, Ruishi Chen, Pierce Kelaita +6Human Preference EvaluationLLM Evaluation

  4. By Their Fruits You Will Know Them: Comparing Formalizations of Law by the Decisions They Encode

    May 24, 2026Julius Vernie, Matthias GrabmairLLM EvaluationDifferential Testing

  5. Faithfulness Metrics Don't Measure Faithfulness: A Meta-Evaluation with Ground Truth

    May 24, 2026Yoav Gur-Arieh, Ana Marasović, Mor GevaCoT FaithfulnessLLM Evaluation

  6. Large Language Model Selection with Limited Annotations

    May 24, 2026Yavuz Durmazkeser, Patrik Okanovic, Andreas Kirsch +2Model SelectionLLM Evaluation

  7. Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges

    May 24, 2026Xianglin Yang, Bryan Hooi, Gelei Deng +2LLM EvaluationLLM-as-a-Judge

  8. Automated Detection and Classification of Delusion-related Content in Naturalistic Audio Diaries Using Multi-Agent Language Models

    May 23, 2026Feng Chen, Justin Tauscher, Changye Li +7LLM EvaluationMulti-Agent LLMs

  9. TS-Skill: A Benchmark for Evaluating Analytical Skills in Time-Series Question Answering

    May 23, 2026Liying Han, Kang Yang, Oliver Wang +9LLM EvaluationTime Series Reasoning

  10. Emotional intelligence in large language models is fragmented across perception, cognition, and interaction

    May 23, 2026Minghao Lv, Lu Chen, Enchang Zhang +6LLM EvaluationLLM Alignment

  11. When Mean CE Fails: Median CE Can Better Track Language Model Quality

    May 23, 2026Hao Guo, Simon Dennis, Rivaan Patil +1LLM EvaluationLLM Training

  12. Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework

    May 23, 2026Ali Şenol, Garima Agrawal, Huan LiuLLM EvaluationLanguage Model Robustness

  13. AstroMind: A High-Fidelity Benchmark for Spacecraft Behavior Reasoning Based on Large Language Models

    May 23, 2026Hao Liu, Siyuan Yang, Qinglei Hu +1LLM Evaluation

  14. EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy

    May 23, 2026Jinzhao Li, Yinuo Chen, Dongxu Piao +9Spatial Reasoning BenchmarksLLM Evaluation

  15. LLMTabBench: Evaluating LLMs on Binary Tabular Classification From Zero to Few Shots

    May 23, 2026Daria Grushina, Kseniia Kuvshinova, Alina Kostromina +3Zero-Shot LearningLLM Evaluation

  16. How Much Structure Do LLMs Need? Evaluating LLMs for Bibliometric Cluster Description

    May 23, 2026Abraham Camelo-Guerrero, Jairo Diaz-RodriguezLLM EvaluationClustering

  17. ChaosBench-Logic v2: Evaluating LLM Logical Reasoning over Dynamical Systems at Scale

    May 23, 2026Noel ThomasLLM EvaluationLanguage Model Robustness

  18. Enhancing Reliability in LLM-Based Secure Code Generation

    May 22, 2026Mohammed F. Kharma, Mohammad Alkhanafseh, Ahmed Sabbah +1LLM EvaluationCoT Reasoning

  19. How Well Do Models Follow Their Constitutions?

    May 22, 2026Arya Jakkli, Senthooran Rajamanoharan, Neel NandaLLM EvaluationLanguage Model Safety Evaluation

  20. Teaching Through Analogies: A Modular Pipeline for Educational Analogy Generation

    May 22, 2026Mariam Barakat, Ekaterina KochmarLLM EvaluationLLM Grounding

  21. NLG Evaluation: Past, Present, Future

    May 22, 2026Ehud ReiterLLM EvaluationLanguage Model Generation Evaluation

  22. How Human-Like Are Large Language Models? A Register-Aware Linguistic Evaluation Framework

    May 22, 2026Björn Nieth, Marianna Gracheva, Michaela Mahlberg +2LLM EvaluationLanguage Model Generation Evaluation

  23. Naturalistic measure of social norms alignment

    May 22, 2026Yevhen Kostiuk, Kenneth Enevoldsen, Peter Bjerregaard Vahlstrup +2Social DilemmasLLM Evaluation

  24. Instance-Optimal Estimation with Multiple LLM Judges on a Budget

    May 22, 2026Junghyun Lee, Sanghwa Kim, Yassir Jedra +2Parameter EstimationLLM Evaluation