LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. Encoded but Not Decoded: Layer-Localized Evidence for a Three-Level Gap in LLM Syntax

    Sep 24, 2026Zhenyan Lu, He Wang, Xiaohui HuangLLM EvaluationLanguage Model Decoding

  2. SEEK: Skill-Routed Evaluation with Evolvable Knowledge for Industrial Search

    Sep 24, 2026Zhongxin Huang, Songyang Li, Renzhe Zhou +5LLM EvaluationAutomated Evaluation

  3. Large Language Models for Programming: Actually Fixing or Reimplementing Incorrect Code?

    Sep 24, 2026Alexandru Stefan Stoica, Traian Rebedea, Marian Cristian MihaescuLLM EvaluationAutomated Program Repair

  4. Likelihood Ranking doesn't Scale Like Prompting in LLMs

    Sep 24, 2026Alessandro Bondielli, Lucia Passaro, Davide Bacciu +1LLM EvaluationLanguage Model Generation Evaluation

  5. From Policy Documents to Structured Survey Responses: Evaluating Large Language Models for Policy Monitoring

    Sep 24, 2026Carolyn Cole, Matthias Deschryvere, Toqeer Ehsan +1LLM EvaluationLLM Information Extraction

  6. Can LLMs Reason About Runtime Behavior? A Repository-Level Dynamic Benchmark

    Sep 23, 2026Hamed Taherkhani, Mohammad Abdollahi, Melika Sepidband +3LLM EvaluationSoftware Engineering Benchmarks

  7. Beyond Poetry: Can Large Language Models Generate Classical Arabic Maqamat?

    Sep 23, 2026AbdulRahman A. Morsy, Aya ZiriklyLLM EvaluationArabic NLP

  8. How Sensitive Are LLM Leaderboard Claims to Hidden Model Selection?

    Sep 23, 2026Chen Yang, Xianyang Zhang, Jun ChenLLM EvaluationSelective Inference

  9. Evaluating Feedback Focus and Pedagogical Adaptivity in LLM-Generated Feedback on Student Writing

    Sep 23, 2026Norah Almousa, Shayan Peyghambari Oskoui, Raquel Coelho +3LLM EvaluationLLM Alignment

  10. Evaluating Open-Weight LLMs for Turkish Domain Documents Under Retrieval and Hardware Constraints

    Sep 23, 2026Imtiaz Ul Hassan, Öykü Akbulut, Onur Kaya +4Multilingual Language Model EvaluationLLM Evaluation

  11. Same Scores, Different Decisions: Evaluating JEV and Language Models for Legal Document Understanding

    Sep 23, 2026Fan Zhang, Yankai Chen, Zhuohan Xie +11LLM EvaluationEfficient Language Model Inference

  12. When Context Misleads: In-context Learning with Jurisdiction in Large Language Models

    Sep 23, 2026Pei-lin Li, Qingle Liu, Junyang Feng +4LLM EvaluationIn-Context Learning

  13. Speculative Evaluation of Stochastic LLMs

    Sep 23, 2026Qianli Shen, Xiang Li, Ruomeng Ding +3LLM EvaluationLanguage Model Generation Evaluation

  14. Uncheatable Eval: Dynamic Compression-Based Evaluation of Language Models

    Sep 23, 2026Kaifeng Tan, Yudong Li, Linlin ShenLLM EvaluationData Contamination in Language Models

  15. A retrospective analysis on the use of LLMs to study infant syntax learning

    Sep 22, 2026Hélie Bazin, Anouk Barberousse, François YvonLLM EvaluationLanguage Modeling

  16. Calibration as a First-Class Criterion in LLM Evaluation

    Sep 22, 2026Mario Sanz-Guerrero, Katharina von der WenseLLM EvaluationConfidence Estimation in Language Models

  17. EADC: Evaluation of Advanced and Deep-level Compliance in Large Language Models

    Sep 22, 2026Yan Zhang, Ruien Li, Yaoyao Peng +4LLM Safety BenchmarksLLM Evaluation

  18. CQ4OE: A benchmark for assessing LLM-assisted ontology generation from competency questions

    Sep 22, 2026Jiayi Li, Ziyuan Wang, Daniel Garijo +1LLM EvaluationOntology Learning

  19. Efficient Cost-Aware LLM Evaluation via Bayesian Bandit Gittins Indices

    Sep 22, 2026Qian Xie, Yueli He, Nairen CaoMulti-Armed BanditsLLM Evaluation

  20. SSP-Bench: A Hybrid Data Generation Framework for Safety, Security, and Privacy Evaluation

    Sep 21, 2026Fatih Deniz, Yazan Boshmaf, Issa KhalilLLM Safety BenchmarksLLM Evaluation

  21. Evaluating Decision Models for Text Annotation in Computational Social Science

    Sep 21, 2026Hazem Ibrahim, Yasir ZakiLLM EvaluationLLM-Assisted Annotation

  22. LLJ Cards: Best practices for the Use of LLMs as Judges

    Sep 21, 2026Khaoula Chehbouni, Melina Medjdoub, Florian Carichon +2LLM EvaluationLLM-as-a-Judge