LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Analyzing LLM Reasoning to Uncover Mental Health Stigma

    Apr 27, 2026Sreehari Sankar, Aliakbar Nafar, Mona Barman +8LLM EvaluationSocial Bias in Language Models

  2. Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination

    Apr 27, 2026Lirong Gao, Zeqing Wang, Yuyan Cai +6LLM EvaluationQuestion Answering

  3. Benchmarking Source-Sensitive Reasoning in Turkish: Humans and LLMs under Evidential Trust Manipulation

    Apr 27, 2026Sercan Karakaş, Yusuf ŞimşekLLM Evaluation

  4. STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator

    Apr 27, 2026Alessio Sordo, Lingxiao Du, Meeka-Hanna Lenisa +2LLM EvaluationSynthetic Data Generation

  5. Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora

    Apr 27, 2026Chenkai Pan, Xinglong Xu, Yuhang Xu +6LLM EvaluationKnowledge Augmentation for Language Models

  6. SWE-QA: A Dataset and Benchmark for Complex Code Understanding

    Apr 27, 2026Laïla Elkoussy, Julien PerezLLM EvaluationSoftware Engineering Benchmarks

  7. Culture-Aware Machine Translation in Large Language Models: Benchmarking and Investigation

    Apr 27, 2026Zekun Yuan, Yangfan Ye, Xiaocheng Feng +5LLM EvaluationCultural Knowledge in Language Models

  8. Multi-Dimensional Evaluation of Sustainable City Trips with LLM-as-a-Judge and Human-in-the-Loop

    Apr 27, 2026Ashmi Banerjee, Adithi Satish, Wolfgang Wörndl +1LLM EvaluationLLM-as-a-Judge

  9. An Information-Geometric Framework for Stability Analysis of Large Language Models under Entropic Stress

    Apr 27, 2026Hikmat Karimov, Rahid Zahid AlekberliLLM EvaluationLLM Reliability

  10. How LLMs Fail and Generalize in RTL Coding for Hardware Design?

    Apr 26, 2026Guan-Ting Liu, Chao-Han Huck Yang, Chenhui Deng +3LLM EvaluationCode Generation

  11. Expert Evaluation of LLM's Open-Ended Legal Reasoning on the Japanese Bar Exam Writing Task

    Apr 26, 2026Jungmin Choi, Keisuke Sakaguchi, Hiroaki YamadaLLM EvaluationHallucination in Language Models

  12. Benchmarking Testing in Automated Theorem Proving

    Apr 26, 2026Jongyoon Kim, Hojae Han, Seung-won HwangLLM EvaluationAutomated Theorem Proving

  13. The Collapse of Heterogeneity in Silicon Philosophers

    Apr 26, 2026Yuanming Shi, Andreas HauptLLM Evaluation

  14. JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems

    Apr 26, 2026Rohith Reddy Bellibatlu, Edward Raff, Wenbin ZhangLLM EvaluationLLM-as-a-Judge

  15. Evaluating Large Language Models on Computer Science University Exams in Data Structures

    Apr 25, 2026Edan Gabay, Yael Maoz, Jonathan Stahl +7LLM EvaluationComputer Science Education

  16. Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective

    Apr 25, 2026Bishwamittra Ghosh, Soumi Das, Till Speicher +5LLM EvaluationLLM Fine-Tuning

  17. Evaluating Temporal Consistency in Multi-Turn Language Models

    Apr 24, 2026Yash Kumar Atri, Steven L. Johnson, Tom HartvigsenLLM EvaluationTemporal Reasoning in Language Models

  18. A Systematic Approach for Large Language Models Debugging

    Apr 24, 2026Basel Shbita, Anna Lisa Gentile, Bing Zhang +10LLM Evaluation

  19. Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity

    Apr 24, 2026Erez Yosef, Oron Anschel, Shunit Haviv Hakimi +4Mathematical Reasoning BenchmarksLLM Evaluation

  20. BLAST: Benchmarking LLMs with ASP-based Structured Testing

    Apr 24, 2026Manuel Alejandro Borroto Santana, Erica Coppolillo, Francesco Calimeri +3Logic ProgrammingLLM Evaluation