LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. EdgeFlowerTune: Evaluating Federated LLM Fine-Tuning Under Realistic Edge System Constraints

    May 9, 2026Jiaxiang Geng, Yiyi Lu, Lunyu Zhao +3LLM EvaluationLLM Fine-Tuning

  2. DiagnosticIQ: A Benchmark for LLM-Based Industrial Maintenance Action Recommendation from Symbolic Rules

    May 9, 2026Devin Yasith De Silva, Dhaval Patel, Christodoulos Constantinides +7Logical ReasoningLLM Evaluation

  3. Evaluating Developmental Cognition Capabilities of LLMs

    May 8, 2026Xiao Xiao, Hayoun Noh, Mar Gonzalez-FrancoLLM Evaluation

  4. Coordinates of Capability: A Unified MTMM-Geometric Framework for LLM Evaluation

    May 8, 2026Adib Sakhawat, Tahsin Islam, Takia Farhin +3LLM EvaluationLanguage Model Robustness

  5. CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs

    May 8, 2026Shiyang Li, Zijian Zhang, Guangyan Sun +5LLM EvaluationGPU Kernel Optimization

  6. Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment

    May 8, 2026I. F. Atasoy, B. Mutlu, E. A. Sezer +1LLM EvaluationLLM-Assisted Annotation

  7. CUDABeaver: Benchmarking LLM-Based Automated CUDA Debugging

    May 8, 2026Shiyang Li, Haoyang Chen, Mattia Fazzini +1LLM EvaluationAutomated Program Repair

  8. Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks

    May 8, 2026Ramon Pires, Thales Sales Almeida, Celio Larcher Junior +6Legal NLPLLM Evaluation

  9. A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering

    May 8, 2026Zhanliang Wang, Jiancong Xiao, Ruochen Jin +3LLM EvaluationConfidence Estimation in Language Models

  10. Sanity Checks for Long-Form Hallucination Detection

    May 8, 2026Geigh Zollicoffer, Minh Vu, Hongli Zhan +2LLM EvaluationHallucination Detection

  11. Augmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need?

    May 8, 2026Jane Paik KimLLM EvaluationLLM-as-a-Judge

  12. CoCoReviewBench: A Completeness- and Correctness-Oriented Benchmark for AI Reviewers

    May 8, 2026Hexuan Deng, Xiaopeng Ke, Yichen Li +6LLM EvaluationAutomated Peer Review

  13. Beyond Confidence: Rethinking Self-Assessments for Performance Prediction in LLMs

    May 8, 2026Sree Bhattacharyya, Samarth Khanna, Leona Chen +3LLM EvaluationConfidence Estimation in Language Models

  14. Tracing Uncertainty in Language Model "Reasoning"

    May 8, 2026Nils Grünefeld, Bertram Højer, Philipp Mondorf +5LLM EvaluationCoT Reasoning

  15. Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs

    May 8, 2026Andrea Sassella, Andrea Chizzola, Tommaso Bianchi +2LLM EvaluationMixture-of-Experts Language Models

  16. FactoryBench: Evaluating Industrial Machine Understanding

    May 8, 2026Yanis Merzouki, Coral Izquierdo, Matei Ignuta-Ciuncanu +8ManufacturingLLM Evaluation

  17. Quality-Conditioned Agreement in Automated Short Answer Scoring: Mid-Range Degradation and the Impact of Task-Specific Adaptation

    May 8, 2026Abigail Victoria Gurin Schleifer, Moriah Ariely, Beata Beigman Klebanov +2LLM EvaluationAI in Education

  18. Multi-Dimensional Evaluation of LLMs for Grammatical Error Correction

    May 8, 2026Adnan Labib, Qiao Wang, Yixuan Huang +1LLM EvaluationGrammatical Error Correction

  19. Post-training makes large language models less human-like

    May 8, 2026Marcel Binz, Elif Akata, Abdullah Almaatouq +76LLM EvaluationLLM Alignment

  20. Position: The Term "Machine Unlearning" Is Overused in LLMs

    May 8, 2026Sangyeon Yoon, Yeachan Jun, Albert NoLLM EvaluationMachine Unlearning

  21. Prompt Engineering Strategies for LLM-based Qualitative Coding of Psychological Safety in Software Engineering Communities: A Controlled Empirical Study

    May 8, 2026Moaath Alshaikh, Tasneem Alshaher, Ricardo Vieira +7Software EngineeringLLM Evaluation

  22. Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

    May 8, 2026Saloni Garg, Amit SagtaniLLM EvaluationLLM-as-a-Judge

  23. From 0-Order Selection to 2-Order Judgment: Combinatorial Hardening Exposes Compositional Failures in Frontier LLMs

    May 8, 2026Hanmeng Liu, Shichao Weng, Xiulai Liu +3Logical ReasoningLLM Evaluation

  24. FAME: Forecasting Academic Impact via Continuous-Time Manifold Evolution

    May 8, 2026Jianrong Ding, Jianyuan Zhong, Zhengyan Shi +1AI for ScienceLLM Evaluation

  25. The Text Uncanny Valley: Non-Monotonic Performance Degradation in LLM Information Retrieval

    May 8, 2026Zekai Tong, Ruiyao Xu, Aryan Shrivastava +2LLM EvaluationLLM Reliability

  26. The Position Curse: LLMs Struggle to Locate the Last Few Items in a List

    May 8, 2026Zhanqi Zhang, Hua-Dong Xiong, Robert C. Wilson +3LLM EvaluationLLM Fine-Tuning

  27. SAGE: Hierarchical LLM-Based Literary Evaluation through Ontology-Grounded Interpretive Dimensions

    May 8, 2026Tianyu Wang, Nianjun ZhouComputational Literary StudiesLLM Evaluation

  28. NSMQ Riddles: A Benchmark of Scientific and Mathematical Riddles for Quizzing Large Language Models

    May 8, 2026George Boateng, Naafi Ibrahim, Samuel John +8Mathematical Reasoning BenchmarksLLM Evaluation

  29. An Interpretable and Scalable Framework for Evaluating Large Language Models

    May 7, 2026Xinhao Qu, Qiang Heng, Hao Zeng +1LLM EvaluationItem Response Theory