LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. TRACE: Toulmin-based Reasoning Assessment through Constructive Elements for LLM CoT Evaluation

    May 28, 2026Yundong Kim, Heyoung YangLLM EvaluationLanguage Model Generation Evaluation

  2. From Blind Guess to Informed Judgment: Teaching LLMs to Evaluate Materials by Building Knowledge-Augmented Preference Signals

    May 28, 2026Yeyong Yu, Wenya Hu, Xing Wu +1LLM EvaluationPairwise Preference Evaluation

  3. SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers

    May 27, 2026Kaihua Qin, Dawn Song, Arthur GervaisLLM EvaluationDifferential Testing

  4. The Routing Plateau: Understanding the Accuracy Limits of LLM Routers

    May 27, 2026Yifan Lu, Qiyue Zhang, Shenrun Zhang +4LLM EvaluationAdaptive Model Routing

  5. Mind Your Tone: Does Tone Alter LLM Performance?

    May 27, 2026Om Dobariya, Akhil KumarLLM EvaluationLLM Prompting

  6. When Models Disagree: Rethinking LLM Evaluation for Public Comment Analysis

    May 27, 2026Aisha Najera, Alvin Moon, Vedant Srinivasan +1LLM EvaluationAnnotator Disagreement

  7. The Trust Paradox: How CS Researchers Engage LLM Leaderboards

    May 27, 2026Pouya Sadeghi, Anamaria Crisan, Jimmy LinModel SelectionLLM Evaluation

  8. PEFT-Arena: Understanding Parameter-Efficient Finetuning from a Stability-Plasticity Perspective

    May 27, 2026Yangyi Huang, Ruotian Peng, Zeju Qiu +4LLM EvaluationFine-Tuning

  9. MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems

    May 27, 2026Xinle Deng, Ruobin Zhong, Hujin Peng +15LLM EvaluationMemory-Augmented Language Models

  10. The Importance of Being Statistically Earnest: A Critical Re-evaluation of GSM-Symbolic

    May 27, 2026Dominika Agnieszka Długosz, Arlindo Oliveira, Natalia Díaz-RodríguezLLM EvaluationGeneralized Linear Models

  11. Measuring Form and Function in Language Models

    May 27, 2026Héctor Javier Vázquez Martínez, Charles YangLLM EvaluationChild Language Acquisition

  12. Satisfiability Solving with LLMs: A Matched-Pair Evaluation of Reasoning Capability

    May 27, 2026Leizhen Zhang, Shuhan Chen, Sheng ChenLLM EvaluationConstraint Satisfaction

  13. MUSE: Benchmarking Manufacturable, Functional, and Assemblable Text-to-CAD Generation

    May 27, 2026Xiaoyu Dong, Zhi Li, Xiao-Ming WuLLM EvaluationText-to-CAD Generation

  14. HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs

    May 27, 2026Yansong Ning, Mianpeng Liu, Jingwen Ye +2LLM EvaluationAdaptive Inference

  15. Argument Quality Assessment with Large Language Models: A Pairwise Bradley-Terry Approach

    May 27, 2026Nicolás Benjamín Ocampo, Agnes Paullate Nyiranziza, Davide CeolinLLM EvaluationPairwise Ranking

  16. BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law

    May 27, 2026Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach +6Legal NLPLLM Evaluation

  17. ATLAS: All-round Testing of Long-context Abilities across Scales

    May 27, 2026Deli Huang, Cunguang Wang, Hongyin Tang +15LLM EvaluationBenchmark Construction

  18. PetroBench: A Benchmark for Large Language Models in Petroleum Engineering

    May 27, 2026Xiang Wang, Tingting Zhang, Sen Wang +4LLM EvaluationQuestion Answering

  19. The Missing Piece in Pre-trained Model Evaluation: Reward-Guided Decoding Unlocks Task-Oriented Behavior Without Parameter Updates

    May 27, 2026Shaobo Wang, Guo Chen, Ziyue Wang +5LLM EvaluationLanguage Model Decoding

  20. SuiChat-CN: Benchmarking Contextual Suicide Risk Assessment in Chinese Group Chats

    May 27, 2026Xiangyu Wang, Zhiwei Yu, Chengze Du +3Social Media AnalysisLLM Evaluation

  21. FinBoardBench: Benchmarking Dynamic Wealth Management and Strategic Financial Reasoning of LLMs via Board Game Simulations

    May 27, 2026Xuesi Hu, Peng Wang, Jinpeng Miao +7LLM EvaluationFinance

  22. PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management

    May 27, 2026Yuxuan Zhao, Sijia Chen, Ningxin SuLLM EvaluationQuantitative Finance

  23. ChildEval: When large language models meet children's personalities

    May 27, 2026Yanyan Luo, Xue Han, Chunxu Zhao +5LLM EvaluationLLM Personalization