LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Coresets Before Score Sets: Evaluation-Unsupervised Prompt Subset Selection for LLM Benchmarks

    Jul 2, 2026Jihan Yao, Gantavya Bhatt, Arnav Das +16Submodular OptimizationLLM Evaluation

  2. Know Your Source: A Public Knowledge Store for Media Background Checks

    Jul 2, 2026Benjamin Nichols, Michael Schlichtkrull, Nedjma OusidhoumLLM EvaluationAutomated Fact-Checking

  3. Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization

    Jul 2, 2026Jan DrchalLLM EvaluationLanguage Model Generation Evaluation

  4. Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge

    Jul 2, 2026Alex Brooker, Tim HughesLLM Evaluation

  5. Geometric Signatures of Reasoning: A Spectral Perspective on Task Hardness

    Jul 2, 2026Aria Masoomi, Mahsa Bazzaz, Adel Javanmard +1LLM EvaluationRepresentation Geometry in Language Models

  6. Parameter Golf: What Really Works?

    Jul 1, 2026Prashanna Mani Paudel, Shivanand Venkanna SheshappanavarLLM EvaluationLLM Compression

  7. IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs

    Jul 1, 2026Samir Abdaljalil, Erchin Serpedin, Hasan KurbanLLM EvaluationScientific Reasoning

  8. RusFinChain: A Russian Benchmark for Verifiable Chain-of-Thought Reasoning in Finance with Fuzzy-Aligned Evaluation

    Jul 1, 2026M. K. ArabovLogical ReasoningLLM Evaluation

  9. Measuring the Gap Between Human and LLM Research Ideas

    Jul 1, 2026Ziyu Chen, Yilun Zhao, Arman CohanLLM EvaluationScientific Hypothesis Generation

  10. AGC-Bench: Measuring Artificial General Creativity

    Jul 1, 2026Roger Beaty, Vijeta Deshpande, Clin K. Y. Lai +9Creativity AssessmentLLM Evaluation

  11. Quantifying the Affective Gap: A Zero-Shot Evaluation of LLMs on Fine-Grained Emotion Taxonomies

    Jul 1, 2026Lawrence Obiuwevwi, Krzysztof J. Rechowicz, Jessica M. Johnson +3LLM EvaluationZero-Shot Text Classification

  12. Persona Non Grata: LLM Persona-Driven Generations in MCQA are Unstable in Distinct Dimensions

    Jul 1, 2026César Guerra-Solano, Xiang Lorraine LiLLM EvaluationLanguage Model Generation Evaluation

  13. MetaHOPE: A Metaphor-Oriented Evaluation Framework for Analysing MT and LLM Translation Errors

    Jul 1, 2026Jiahui Liang, Lifeng HanLLM EvaluationMachine Translation

  14. MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark

    Jul 1, 2026Xianru Chen, Yukai Huang, Mingxiang Chen +6Multilingual Language Model EvaluationLLM Evaluation

  15. LLVM-Bench: Benchmarking and Advancing Large Language Models for LLVM Compiler Issue Resolution

    Jul 1, 2026Zhao Tian, Yingquan Zhao, Chenyao Suo +2LLM EvaluationAutomated Program Repair

  16. YOMI-Bench: A Benchmark for Evaluating Kanji Reading and Phonological Understanding of LLMs for Japanese

    Jul 1, 2026Ryota Mibayashi, Hiroya Takamura, Hitomi YanakaLLM Evaluation

  17. The Moving Target: A Longitudinal Audit of Trustworthiness Drift Across Twelve Checkpoints of Open-Source Chat LLMs

    Jul 1, 2026Zhichao Fan, Yanhang Li, Zexin Zhuang +2LLM Safety BenchmarksLLM Evaluation

  18. Beyond Perplexity: A Behavioral Evaluation Framework for Deployment-Memory Claims in LLM Test-Time Training

    Jul 1, 2026Xiangchen Song, Zhenhao Chen, Lingjing Kong +4LLM EvaluationLLM Memory

  19. An LLM-Based Framework for Intent-Driven Network Topology Design

    Jul 1, 2026Kholoud El-Habbouli, Fen Zhou, Stephane HuetLLM EvaluationGraph Generation

  20. SEFORA: Student Essays with Feedback Corpus and LLM Feedback Evaluation Framework

    Jun 30, 2026Shayan Peyghambari Oskoui, Norah Almousa, Zhaoyi Joey Hou +5LLM EvaluationLanguage Model Generation Evaluation

  21. When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors

    Jun 30, 2026Yuqing Yang, Qi Zhu, Zhen Han +5LLM EvaluationLLM Grounding

  22. CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes

    Jun 30, 2026Yuchen Huang, Xiang Li, Zhenqing Ling +5LLM EvaluationInstruction Following

  23. Benchmarking Large Language Models on Floating-Point Error Classification

    Jun 30, 2026Lisa Taldir, Muhammad Ahmad Saeed, David Defour +2LLM EvaluationStatic Code Analysis

  24. Can LLMs Imagine Moral Alternatives Beyond Binary Dilemmas?

    Jun 30, 2026Jongchan Choi, Nari Yang, Sung Soo Park +4LLM EvaluationMoral Reasoning in Language Models

  25. Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies

    Jun 30, 2026Xudong Shen, Li Yuan, Ye Chen +3LLM EvaluationAdversarial Attacks on LLMs

  26. Prompting GPT-5 on Scrum Certification Questions: An Empirical Accuracy Study

    Jun 29, 2026Mirko Perkusich, Danyllo Albuquerque, João Paiva +6Software EngineeringLLM Evaluation