LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. MathDuels: Evaluating LLMs as Problem Posers and Solvers

    Apr 23, 2026Zhiqiu Xu, Shibo Jin, Shreya Arya +1Mathematical Reasoning BenchmarksLLM Evaluation

  2. Revisiting Non-Verbatim Memorization in Large Language Models: The Role of Entity Surface Forms

    Apr 23, 2026Yuto Nishida, Naoki Shikoda, Yosuke Kishinami +4LLM EvaluationMemorization in Language Models

  3. A Metamorphic Testing Approach to Diagnosing Memorization in LLM-Based Program Repair

    Apr 23, 2026Milan De Koning, Ali Asgari, Pouria Derakhshanfar +1LLM EvaluationMetamorphic Testing

  4. OptiVerse: A Comprehensive Benchmark towards Optimization Problem Solving

    Apr 23, 2026Xinyu Zhang, Boxuan Zhang, Yuchen Wan +5LLM EvaluationBenchmark Design

  5. Evaluating AI Meeting Summaries with a Reusable Cross-Domain Pipeline

    Apr 23, 2026Philip Zhong, Don Wang, Jason ZhangLLM EvaluationFactual Consistency Evaluation

  6. Diagnosing CFG Interpretation in LLMs

    Apr 22, 2026Hanqi Li, Lu Chen, Kai YuLLM EvaluationIn-Context Learning

  7. Exploiting LLM-as-a-Judge Disposition on Free Text Legal QA via Prompt Optimization

    Apr 22, 2026Mohamed Hesham Elganayni, Runsheng Chen, Sebastian Nagl +1LLM EvaluationLLM-as-a-Judge

  8. Cross-Dataset Bloom Question Classification: Supervised Models and Prompted LLMs

    Apr 22, 2026Abdolali Faraji, Mohammadreza Molavi, Zohreh Rasoulkhani +2LLM EvaluationEducational Assessment

  9. Early-Stage Product Line Validation Using LLMs: A Study on Semi-Formal Blueprint Analysis

    Apr 22, 2026Viet-Man Le, Thi Ngoc Trang Tran, Sebastian Lubos +2Software EngineeringLLM Evaluation

  10. Benchmarking Large Language Models for Safety Data Extraction

    Apr 22, 2026Jonas Grill, Thomas Bayer, Sören BerlingerLLM EvaluationLLM Prompting

  11. DialToM: A Theory of Mind Benchmark for Forecasting State-Driven Dialogue Trajectories

    Apr 22, 2026Neemesh Yadav, Palakorn Achananuparp, Jing Jiang +1LLM EvaluationTheory of Mind

  12. CyberCertBench: Evaluating LLMs in Cybersecurity Certification Knowledge

    Apr 22, 2026Gustav Keppler, Ghada Elbez, Veit HagenmeyerLLM EvaluationCybersecurity

  13. The Path Not Taken: Duality in Reasoning about Program Execution

    Apr 22, 2026Eshgin Hasanov, Md Mahadi Hassan Sibat, Santu Karmaker +1LLM EvaluationCode Language Models

  14. Cross-Model Consistency of AI-Generated Exercise Prescriptions: A Repeated Generation Study Across Three Large Language Models

    Apr 21, 2026Kihyuk LeeLLM EvaluationClinical Language Model Evaluation

  15. Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews

    Apr 21, 2026Bowen Li, Haochen Ma, Yuxin Wang +5LLM EvaluationRubric-Based Evaluation

  16. Domain-level metacognitive monitoring in frontier LLMs: A 33-model atlas

    Apr 21, 2026Jon-Paul CacioliLLM Evaluation

  17. Are Large Language Models Economically Viable for Industry Deployment?

    Apr 21, 2026Abdullah Mohammad, Sushant Kumar Ray, Pushkar Arora +5LLM Inference EfficiencyLLM Evaluation

  18. Evaluating LLM-Driven Summarisation of Parliamentary Debates with Computational Argumentation

    Apr 21, 2026Eoghan Cunningham, Derek Greene, James Cross +1LLM EvaluationFactual Consistency Evaluation

  19. IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text

    Apr 21, 2026Rajveer Singh PallLLM EvaluationFinancial QA

  20. CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks

    Apr 21, 2026Peiqin Lin, Chenyang Lyu, Wenjiang Luo +22Multilingual Language Model EvaluationLLM Evaluation