LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. HalluScore: Large Language Model Hallucination Question Answering Benchmark

    May 16, 2026Aisha Alansari, Hamzah LuqmanMultilingual Language Model EvaluationLLM Evaluation

  2. PaliBench: A Multi-Reference Blueprint for Classical Language Translation Benchmarks

    May 16, 2026Máté Metzger, Nadnapang PhophichitLLM EvaluationMachine Translation

  3. GPF-LiveNews: A Streaming Evaluation Protocol for Group-Conditioned Framing in Large Language Models

    May 16, 2026Mohd Ariful Haque, Fahad Rahman, Kishor Datta Gupta +1LLM EvaluationLLM Auditing

  4. Exploring Lightweight Large Language Models for Court View Generation

    May 16, 2026Zhitian Hou, Tianyong Hao, Nanli Zeng +2LLM EvaluationSmall Language Models

  5. LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning

    May 15, 2026Shradha Agarwal, Deepak Rajbhar, Tariq JMathematical Reasoning BenchmarksLLM Evaluation

  6. SKG-Eval: Stateful Evaluation of Multi-Turn Dialogue via Incremental Semantic Knowledge Graphs

    May 15, 2026Avijit Shil, Suman SamuiLLM EvaluationFactual Consistency Evaluation

  7. A Unified Perturbation Framework for Analyzing Leaderboard Stability and Manipulation

    May 15, 2026Hosna Oyarhoseini, Jimmy Lin, Amir-Hossein KarimiLLM EvaluationLearning to Rank

  8. Evaluating Chinese Ambiguity Understanding in Large Language Models

    May 15, 2026Junwen Mo, Yuanzhi Lu, Yifang Xue +2LLM Evaluation

  9. MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models

    May 15, 2026Weixin Liu, Congning Ni, Shelagh A. Mulvaney +4LLM EvaluationHealthcare

  10. RTL-BenchMT: Dynamic Maintenance of RTL Generation Benchmark Through Agent-Assisted Analysis and Revision

    May 15, 2026Jing Wang, Shang Liu, Hangan Zhou +1LLM EvaluationElectronic Design Automation

  11. Neural Activation Patterns Across Language Model Architectures: A Comprehensive Analysis of Cognitive Task Performance

    May 14, 2026Mahdi Naser-Moghadasi, Faezeh GhaderiLLM EvaluationDecoder-Only Language Models

  12. Margin-Adaptive Confidence Ranking for Reliable LLM Judgement

    May 14, 2026Gaojie Jin, Yong Tao, Lijia Yu +1LLM EvaluationLLM-as-a-Judge

  13. LPDS: Evaluating LLM Robustness Through Logic-Preserving Difficulty Scaling

    May 14, 2026Philipp Mondorf, Samuel J. Bell, Jesse Dodge +1LLM EvaluationNeural Network Robustness

  14. Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory

    May 14, 2026Songwei Dong, Zihan Chen, Chengshuai Shi +3Continual Learning for LLMsLLM Evaluation

  15. Zero-Shot Goal Recognition with Large Language Models

    May 14, 2026Kin Max Piamolini Gusmão, Nathan Gavenski, Nir Oren +1Zero-Shot LearningLLM Evaluation

  16. Small, Private Language Models as Teammates for Educational Assessment Design

    May 14, 2026Chris Davis Jaldi, Anmol Saini, Shan Zhang +3LLM EvaluationLLM-as-a-Judge

  17. XDomainBench: Diagnosing Reasoning Collapse in High-Dimensional Scientific Knowledge Composition

    May 14, 2026Gong Zhiren, Tiantong Wu, Jiaming Zhang +9AI for ScienceLLM Evaluation

  18. Dimension-Level Intent Fidelity Evaluation for Large Language Models: Evidence from Structured Prompt Ablation

    May 14, 2026GAng PengMultilingual Language Model EvaluationLLM Evaluation

  19. Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

    May 14, 2026Assaf Gerner, Netta Madvil, Nadav Barak +11LLM EvaluationRAG Evaluation

  20. The Great Pretender: A Stochasticity Problem in LLM Jailbreak

    May 14, 2026Jean-Philippe Monteuuis, Cong Chen, Jonathan PetitLLM Safety BenchmarksLLM Evaluation

  21. Unsteady Metrics and Benchmarking Cultures of AI Model Builders

    May 13, 2026Stefan Baack, Christo Buschek, Maty BohacekLLM EvaluationBenchmark Design

  22. Do Language Models Align with Brains? Prediction Scores Are Not Enough

    May 13, 2026Xiao JiaLLM Evaluation

  23. Improving Reproducibility in Evaluation through Multi-Level Annotator Modeling

    May 13, 2026Deepak Pandita, Flip Korn, Chris Welty +1Inter-Rater ReliabilityLLM Evaluation

  24. (How) Do Large Language Models Understand High-Level Message Sequence Charts?

    May 13, 2026Mohammad Reza MousaviLLM EvaluationChart Understanding