LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

    Aug 5, 2026Yinghui He, Ling Yang, Jiarui Liu +6LLM EvaluationReasoning Evaluation

  2. Same Formulas, Different Semantics: Do Language Models Follow Modal Logic Specifications?

    Aug 5, 2026Réemi Andrieu, Damien SileoLogical ReasoningLLM Evaluation

  3. Revealed Rationality: Label-Free Evaluation and Regularization from Representation Theorems

    Aug 5, 2026Isaiah AndrewsLLM EvaluationReference-Free Evaluation

  4. SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models

    Aug 5, 2026Sihan Hu, Lyuhan Huang, Youjin Deng +1LLM EvaluationScientific Code Generation

  5. LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs

    Aug 5, 2026Jiahao Zhang, Yongzhi Tong, Zelin Fu +4LLM EvaluationLLM Personalization

  6. Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification

    Aug 5, 2026Elena Merdjanovska, Omar Zaidan, Andreas RückléLLM EvaluationSelective Prediction

  7. RepoProbe: Benchmarking Architecture-Aware Repository Comprehension with Checklists

    Aug 5, 2026Yuexi Yang, Alyssa Wu, Ji Luo +4Software EngineeringLLM Evaluation

  8. What We Observe as LLM Behavior Can Be a Side-effect of Inference Backend

    Aug 5, 2026Shahed Masoudian, Passant Shafaei, Monorama Swain +1LLM EvaluationLanguage Model Generation Evaluation

  9. IslamicTurathBench: A Multi-Task, Multi-Discipline Benchmark for Evaluating Large Language Models on the Islamic Scholarly Tradition (turath)

    Aug 5, 2026Shahd Gaben, Heba Sbahi, Samer Rashwani +5LLM EvaluationBenchmark Design

  10. Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark

    Aug 5, 2026Enrico Mensa, Lorenzo Zane, Calogero Jerik Scozzaro +3Figurative Language UnderstandingLLM Evaluation

  11. Evaluating Theory of Mind in Reasoning Models: Robustness over Reasoning

    Aug 5, 2026Ian B. de Haan, Peter van der Putten, Max van DuijnLLM EvaluationTheory of Mind

  12. Agreement Before Diversity: Verification-First Complementarity for Heterogeneous Language-Model Coordination

    Aug 5, 2026Ruitong Li, Binjie Guo, Aisheng Mo +3LLM EvaluationLLM Answer Verification

  13. When Absence Is Evidence: Evaluating Completeness-Sensitive Negative Reasoning in Large Language Models

    Aug 5, 2026Byoungjae Min, Kennedy Edemacu, Sae-Hong Cho +3LLM EvaluationLLM Grounding

  14. The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

    Aug 5, 2026Yushi Sun, Yanjie Zhang, Rui ShengLLM EvaluationLLM Personalization

  15. STRIVE: Probing Reasoning Limits in Graded Plausibility Generation and Evaluation

    Aug 5, 2026Bhiman Kumar Baghel, Anna Chrabaszcz, Tessa Warren +3LLM EvaluationControllable Text Generation

  16. FinReportBench: Measuring and Improving Institution-Grade Financial Report Generation

    Aug 5, 2026Yinghao Tang, Tan Zhenwei, Yiyao Wang +4Financial ServicesLLM Evaluation

  17. Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation

    Aug 5, 2026Bo Xue, Zhi Hong, Jiayi Li +3Multi-Armed BanditsLLM Evaluation

  18. Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

    Aug 4, 2026S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh +1LLM EvaluationTool-Use Evaluation

  19. BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding

    Aug 4, 2026Yangxuan Zhou, Sha Zhao, Yuning Chen +4ElectroencephalographyLLM Evaluation

  20. Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility

    Aug 4, 2026Mohsen Hariri, Weicong Chen, Nahal Shahini +11LLM EvaluationTest-Time Scaling

  21. Evaluating LLMs in Database Scenarios: A Lifecycle Benchmark for Assessing Their Potential in Core Database Tasks

    Aug 4, 2026Shunfan Zheng, Dongsheng Shi, Yue Li +3LLM EvaluationText-to-SQL

  22. How Closely Do LLM Reviews Align with Human Peer Review?

    Aug 4, 2026Abraham Camelo-Guerrero, Jairo Diaz-RodriguezLLM EvaluationHuman-AI Agreement

  23. AI-Assisted Peer Review Across Research Communities: From Reviewer AI Policies to LLM Review Quality

    Aug 4, 2026Alexander M. Fichtl, Lukas Ellinger, Josefin Kelber +2LLM EvaluationScholarly Peer Review