LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. RTL-BenchLS: A Large-Scale Benchmark for RTL Reasoning and Generation with Large Language Models

    Jun 8, 2026Jing Wang, Shang Liu, Wenji Fang +3LLM EvaluationBenchmark Design

  2. Can LLMs understand LilyPond? A benchmark for symbolic music generation and understanding

    Jun 7, 2026Matteo Spanio, Mohammad Torabi, Andrea Poltronieri +1Music Generation EvaluationLLM Evaluation

  3. From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape

    Jun 7, 2026Hao Chen, Ziyu Han, Yukun Yan +3LLM EvaluationRubric-Based Evaluation

  4. Multilingual Fact-Checking at Scale: Fine-Tuned Compact Models vs LLMs

    Jun 7, 2026Pratuat Amatya, Vinay SettyMultilingual Language ModelsLLM Evaluation

  5. Testing the Black Box: Structural Barriers to Independent Evaluation of Consumer-Facing Health LLMs

    Jun 7, 2026Rahul Gorijavolu, Kaushik Madapati, Pritika Vig +7LLM EvaluationLLM Sycophancy

  6. Impacts of Histories and Models on LLM Grading: A Study in Advanced Software Engineering Courses

    Jun 7, 2026Qilin Zhou, Zhuo Wang, Yue Li +1LLM EvaluationLLM-as-a-Judge

  7. SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

    Jun 6, 2026Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi +3LLM EvaluationSynthetic Benchmark Generation

  8. IDP-Bench: Benchmarking ability of LLMs to protect personal information in interdependent privacy contexts

    Jun 6, 2026Ayana Hussain, Soumya Sharma, Golnoosh Farnadi +3LLM EvaluationPrivacy-Preserving Language Models

  9. GIScholarBench: Benchmarking LLM Overconfidence in GIS Research

    Jun 6, 2026Zongrng Li, Mingzheng Yang, Lei Zou +8LLM EvaluationAI-Assisted Scientific Research

  10. Arabic Sentence Segmentation Across Genres and Punctuation Conditions

    Jun 6, 2026Mohammed Elkholy, Khalid N. Elmadani, Nizar Habash +1LLM EvaluationArabic NLP

  11. UniQL: Towards Dialect-Universal Benchmarking for Text-to-SQL

    Jun 6, 2026Jianling Gao, Chongyang Tao, Jiayuan Bai +7LLM EvaluationText-to-SQL

  12. Summarization is Not Dead Yet

    Jun 6, 2026Dongqi Liu, Chenxi Whitehouse, Zheng Zhao +3LLM EvaluationText Summarization

  13. Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy

    Jun 6, 2026Yuan Shen, Xiaojun Wu, Linghua YuLLM EvaluationLanguage Model Safety Evaluation

  14. The AI Epistemic Deference Index: A Continuous Measure of Sycophancy

    Jun 5, 2026Alejandro Botas, Paul de Font-Reaulx, Luke HewittLLM EvaluationLLM Sycophancy

  15. How reliable are LLMs when it comes to playing dice?

    Jun 5, 2026Luca Avena, Gianmarco Bet, Bernardo BusoniLLM EvaluationLLM Prompting

  16. Cutting LLM Evaluation Costs with SySRs: A Bandit Algorithm that Provably Exploits Model Similarity

    Jun 5, 2026Zifan Lyu, Chahine Nejma, Tobias Wegel +2Model SelectionMulti-Armed Bandits

  17. Sycophantic Praise: Evaluating Excessive Praise in Language Models

    Jun 5, 2026Daniel Vennemeyer, Phan Anh Duong, Meryl Ye +2LLM EvaluationLLM Sycophancy

  18. The Masked Advantage: Uncovering Local-Language Access to Cultural Knowledge in LLMs

    Jun 5, 2026Yang Zhang, Xiao Fei, Amr Mohamed +6Multilingual Language Model EvaluationLLM Evaluation

  19. Phun-Bench: Evaluating LLMs on Phonological Understanding in Chinese

    Jun 5, 2026Xing Yue, Yongliang Shen, Weiming LuLLM Evaluation

  20. Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models

    Jun 5, 2026Dewi Gould, Francis Rhys Ward, Anders Cairns Woodruff +18LLM EvaluationAI Safety Evaluation

  21. Beyond Rubrics: Exploration-Guided Evaluation Skills for Reward Modeling

    Jun 5, 2026Xing Yue, Linjuan Wu, Daoxin Zhang +2Reward ModelingLLM Evaluation

  22. Adversarial Robustness of Activation Steering in Large Language Models

    Jun 5, 2026Kien Le, Thai LeLLM EvaluationLanguage Model Steering

  23. OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios

    Jun 5, 2026Xinyi Li, Zhen Fang, Yongxin Deng +12LLM EvaluationHallucination Detection

  24. From Sampled Outcomes to Capability Distributions: Rethinking Supervision for LLM Routing

    Jun 5, 2026Guannan Lai, Haoran Hu, Long Chen +2LLM EvaluationLLM Routing

  25. ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning

    Jun 5, 2026Vladislav Smirnov, Chieu Nguyen, Sergey Senichev +14LLM EvaluationTest-Time Scaling