LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation

    Jun 10, 2026Selen Erkan, Bastian Boll, Kristian Kersting +2LLM EvaluationInstruction Following

  2. Automated Creativity Evaluation of Language Models Across Open-Ended Tasks

    Jun 10, 2026Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff +4Creativity AssessmentLLM Evaluation

  3. Can AI Reason Like an Urban Planner? Benchmarking Large Language Models Against Professional Judgment

    Jun 10, 2026Yijie Deng, He Zhu, Wen Wang +3LLM EvaluationUrban Planning

  4. Are LLMs Bad at Moral Reasoning?

    Jun 10, 2026Menghang Zhu, Seth LazarLLM EvaluationMoral Reasoning in Language Models

  5. GraphInfer-Bench: Benchmarking LLM's Inference Capability on Graphs

    Jun 10, 2026Zhuoyi Peng, Jingzhou Jiang, Hanlin Gu +2LLM EvaluationGraph Neural Networks

  6. MPC-Patch-Bench: Security-Aware LLM Code Patch for Multi-Party Computation

    Jun 9, 2026Yukuan Zhang, Mengxin Zheng, Qian LouSecure Multi-Party ComputationLLM Evaluation

  7. Schützen: Evaluating LLM Safety in Bulgarian and German Contexts

    Jun 9, 2026Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  8. Flaws in the LLM Automation Narrative

    Jun 9, 2026George Perrett, Javae Elliott, Jennifer Hill +1LLM EvaluationCode Generation

  9. PhantomBench: Benchmarking the Non-existential Threat of Language Models

    Jun 9, 2026Haeji Jung, Hila GonenLLM EvaluationHallucination in Language Models

  10. Janus: A Benchmark for Goal-Conditioned Information Distortion in LLMs

    Jun 9, 2026Polydoros Giannouris, Mohsinul Kabir, Sophia AnaniadouLLM EvaluationDeception in Language Models

  11. Are We Evaluating Knowledge or Phrasing? Mitigating MCQA Sensitivity with ParaEval

    Jun 9, 2026João Maria Janeiro, Mathurin Videau, Andrea Caciolai +3LLM EvaluationMultiple-Choice Question Answering

  12. Benchmarking Knowledge Editing using Logical Rules

    Jun 9, 2026Tatiana Moteu Ngoli, NDah Jean Kouagou, Hamada M. Zahera +1Knowledge EditingLLM Evaluation

  13. From Context-Aware to Conflict-Aware: Generalizing Contrastive Decoding for Knowledge Conflict in LLMs

    Jun 9, 2026Runze Jiang, Taiqiang Wu, Yan Wang +2LLM EvaluationKnowledge Conflicts in Language Models

  14. Benchmarking and Exploring the Capabilities of LLMs for Attack Investigations

    Jun 9, 2026Aniket Anand, Yiwei Hou, Daniel Fields +4LLM EvaluationCybersecurity

  15. RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning

    Jun 8, 2026Yiteng Mao, Kenan Xu, Yijia Lyu +3Mathematical Reasoning BenchmarksLLM Evaluation

  16. CCBENCH: Assessing LLM Cultural Competence via Implicitly Signaled Norms using Health Queries

    Jun 8, 2026Vasudha Varadarajan, Akhila Yerukola, Mona T. Diab +1LLM EvaluationCultural Bias in Language Models

  17. BenSyc: Benchmarking Conversational Sycophancy and Human Alignment in LLMs for Bengali Contexts

    Jun 8, 2026Kazi Noshin, Sajib Acharjee Dip, Ranat Das Prangon +4Multilingual Language Model EvaluationLLM Evaluation

  18. TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs

    Jun 8, 2026Momina Ahsan, Sarfraz Ahmad, Ming Shan Hee +2Document UnderstandingTable QA

  19. UXBench: Benchmarking User Experience in AI Assistants

    Jun 8, 2026Mengze Hong, Xia Zeng, Zeyang Lei +13LLM EvaluationUser Preference Modeling

  20. Detecting Differences Is Not Understanding Structure: Large Language Models Fail at Graph Isomorphism

    Jun 8, 2026Kumar Thushalika, Sukumar Kishanthan, Asela HevapathigeLLM EvaluationLLM Reasoning with Graphs

  21. TheoremBench: Evaluating LLMs on Theorem Proving in Formal Mathematics

    Jun 8, 2026QuocViet Pham, Elvir Karimov, Andrey Galichin +1Mathematical Reasoning BenchmarksLLM Evaluation

  22. LexRubric: A Rubric-Guided Diagnostic Benchmark for Open-Ended Legal Tasks

    Jun 8, 2026Yifan Chen, Haitao Li, Yiran Hu +6LLM EvaluationRubric-Based Evaluation

  23. How Far Can Prompting Go for Minimal-Edit Ukrainian Grammatical Error Correction?

    Jun 8, 2026Kateryna Karpo, Artem ChernodubLLM EvaluationLLM Prompting

  24. Measurement Under Selection: Decoy-Calibrated Failure Audits for Language Models

    Jun 8, 2026Vyzantinos Repantis, Ameya Gawde, Harshvardhan SinghLLM EvaluationLanguage Model Error Detection