LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. CCBENCH: Assessing LLM Cultural Competence via Implicitly Signaled Norms using Health Queries

    Jun 8, 2026Vasudha Varadarajan, Akhila Yerukola, Mona T. Diab +1LLM EvaluationCultural Bias in Language Models

  2. BenSyc: Benchmarking Conversational Sycophancy and Human Alignment in LLMs for Bengali Contexts

    Jun 8, 2026Kazi Noshin, Sajib Acharjee Dip, Ranat Das Prangon +4Multilingual Language Model EvaluationLLM Evaluation

  3. TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs

    Jun 8, 2026Momina Ahsan, Sarfraz Ahmad, Ming Shan Hee +2Document UnderstandingTable QA

  4. UXBench: Benchmarking User Experience in AI Assistants

    Jun 8, 2026Mengze Hong, Xia Zeng, Zeyang Lei +13LLM EvaluationUser Preference Modeling

  5. Detecting Differences Is Not Understanding Structure: Large Language Models Fail at Graph Isomorphism

    Jun 8, 2026Kumar Thushalika, Sukumar Kishanthan, Asela HevapathigeLLM EvaluationLLM Reasoning with Graphs

  6. TheoremBench: Evaluating LLMs on Theorem Proving in Formal Mathematics

    Jun 8, 2026QuocViet Pham, Elvir Karimov, Andrey Galichin +1Mathematical Reasoning BenchmarksLLM Evaluation

  7. LexRubric: A Rubric-Guided Diagnostic Benchmark for Open-Ended Legal Tasks

    Jun 8, 2026Yifan Chen, Haitao Li, Yiran Hu +6LLM EvaluationRubric-Based Evaluation

  8. How Far Can Prompting Go for Minimal-Edit Ukrainian Grammatical Error Correction?

    Jun 8, 2026Kateryna Karpo, Artem ChernodubLLM EvaluationLLM Prompting

  9. Measurement Under Selection: Decoy-Calibrated Failure Audits for Language Models

    Jun 8, 2026Vyzantinos Repantis, Ameya Gawde, Harshvardhan SinghLLM EvaluationLanguage Model Error Detection

  10. RTL-BenchLS: A Large-Scale Benchmark for RTL Reasoning and Generation with Large Language Models

    Jun 8, 2026Jing Wang, Shang Liu, Wenji Fang +3LLM EvaluationBenchmark Design

  11. Can LLMs understand LilyPond? A benchmark for symbolic music generation and understanding

    Jun 7, 2026Matteo Spanio, Mohammad Torabi, Andrea Poltronieri +1Music Generation EvaluationLLM Evaluation

  12. From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape

    Jun 7, 2026Hao Chen, Ziyu Han, Yukun Yan +3LLM EvaluationRubric-Based Evaluation

  13. Multilingual Fact-Checking at Scale: Fine-Tuned Compact Models vs LLMs

    Jun 7, 2026Pratuat Amatya, Vinay SettyMultilingual Language ModelsLLM Evaluation

  14. Testing the Black Box: Structural Barriers to Independent Evaluation of Consumer-Facing Health LLMs

    Jun 7, 2026Rahul Gorijavolu, Kaushik Madapati, Pritika Vig +7LLM EvaluationLLM Sycophancy

  15. Impacts of Histories and Models on LLM Grading: A Study in Advanced Software Engineering Courses

    Jun 7, 2026Qilin Zhou, Zhuo Wang, Yue Li +1LLM EvaluationLLM-as-a-Judge

  16. SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

    Jun 6, 2026Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi +3LLM EvaluationSynthetic Benchmark Generation

  17. IDP-Bench: Benchmarking ability of LLMs to protect personal information in interdependent privacy contexts

    Jun 6, 2026Ayana Hussain, Soumya Sharma, Golnoosh Farnadi +3LLM EvaluationPrivacy-Preserving Language Models

  18. GIScholarBench: Benchmarking LLM Overconfidence in GIS Research

    Jun 6, 2026Zongrng Li, Mingzheng Yang, Lei Zou +8LLM EvaluationAI-Assisted Scientific Research

  19. Arabic Sentence Segmentation Across Genres and Punctuation Conditions

    Jun 6, 2026Mohammed Elkholy, Khalid N. Elmadani, Nizar Habash +1LLM EvaluationArabic NLP

  20. UniQL: Towards Dialect-Universal Benchmarking for Text-to-SQL

    Jun 6, 2026Jianling Gao, Chongyang Tao, Jiayuan Bai +7LLM EvaluationText-to-SQL

  21. Summarization is Not Dead Yet

    Jun 6, 2026Dongqi Liu, Chenxi Whitehouse, Zheng Zhao +3LLM EvaluationText Summarization

  22. Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy

    Jun 6, 2026Yuan Shen, Xiaojun Wu, Linghua YuLLM EvaluationLanguage Model Safety Evaluation

  23. The AI Epistemic Deference Index: A Continuous Measure of Sycophancy

    Jun 5, 2026Alejandro Botas, Paul de Font-Reaulx, Luke HewittLLM EvaluationLLM Sycophancy

  24. How reliable are LLMs when it comes to playing dice?

    Jun 5, 2026Luca Avena, Gianmarco Bet, Bernardo BusoniLLM EvaluationLLM Prompting