Large Language Model Benchmarks

Latest papers 183

All topics
CardsList
  1. A rubric landscape for evaluating clinical reasoning in large language models: what exists, what is missing, and what needs to be combined

    Oct 1, 2026Zhangshu Joshua Jiang, Zina Ibrahim, James T. TeoClinical Reasoning TrainingLLM Reasoning Strategies

  2. Benchmarking Prompt Optimization of Large Language Models With Chess

    Sep 30, 2026Timothée Lesort, Alejandra López de Aberasturi Gómez, Tristan Karch +4ChessLarge Language Model Benchmarks

  3. Right Answers, Costly Models: The Efficiency Gap in LLM-based Optimization Modeling

    Sep 30, 2026Zhong Li, Xin Huang, Jinhui Wan +6Optimization ModelingLarge Language Model Benchmarks

  4. DatalogBench: Evaluating Large Language Models on Text-to-Datalog Synthesis

    Sep 29, 2026Yuan Li, Hanyun Jiang, Guowei Tian +2Llm-Driven Code SynthesisLarge Language Model Benchmarks

  5. ScAn-Bench: Evaluating Scaling Analysis Methodology

    Sep 28, 2026Artin Sermaxhaj, Nastaran Alipour, Donat Sinani +4Large Language Model BenchmarksWireless Foundation Models

  6. Pass or Fail? Evaluating LLMs on Two Greek Examination Benchmarks

    Sep 28, 2026Panagiota Kyriazi, Eleni Kasoura, Prokopis ProkopidisLarge Language Model BenchmarksLlm-As-A-Judge

  7. AgentPerfBench: A Benchmarking and Evaluation Suite for Inference Performance of Agentic LLMs

    Sep 28, 2026Cheuk Hang Lau, Zeyu Cao, Kevin Wong Cheuk Yin +6Agentic BenchmarksAgentic Inference

  8. Can LLMs Reason About Runtime Behavior? A Repository-Level Dynamic Benchmark

    Sep 23, 2026Hamed Taherkhani, Mohammad Abdollahi, Melika Sepidband +3Large Language Model BenchmarksLLM Reasoning Strategies

  9. MTVA-Bench: Evaluating the Language Model Inside Cascaded Voice Agents

    Sep 17, 2026Pritish Mishra, Ishaan Kumar, Akshat Mandoli +1Voice AgentsDialogue Benchmarks

  10. PetriBench: Benchmarking LLM Reasoning over Dynamic State Spaces

    Sep 17, 2026Pyrros Koussios, Benjamin Jäger, John Hua Yao +3Reasoning BenchmarkLLM Reasoning Strategies

  11. Beyond Outcomes: Dual-View Relational Learning for Efficient Agent Benchmarking

    Sep 16, 2026Xinshuai Guo, Junjie Wu, Dolly Deng +4Agentic BenchmarksLarge Language Model Benchmarks

  12. Correlation-Guided Encoder Selection for Multi-Encoder Large Audio-Language Models

    Sep 16, 2026Pei-Jun Liao, Hung-Shin Lee, Wenze Ren +3Large Audio Language ModelsEncoders

  13. Empirical Evaluation of Open-Source Large Language Models for Retrieval-Augmented Generation in ESG Domain

    Sep 14, 2026Motaz Saad, Anna Borrelli, Ivan Gentile +3Large Language Model BenchmarksEmpirical Study

  14. GTA: Graph Theory Agent and Benchmark for Algorithmic Graph Reasoning with LLMs

    Sep 14, 2026Zixiang Xu, Yanbo Wang, Chenxi Wang +6Graph RepresentationsLarge Language Model Benchmarks

  15. Tasks over Application Manuals: Revealing Gaps in Long-Horizon Procedural Reasoning for Language Models

    Sep 14, 2026Utkarsh Soni, Syed Shariyar Murtaza, Yifan Nie +2Large Language Model BenchmarksNatural Language Processing

  16. SemVerBench: Benchmarking LLM Comprehension of Version-Constraint Resolution Semantics

    Sep 10, 2026Qibai Chen, Zeming LiuVersionLarge Language Model Benchmarks

  17. Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation

    Sep 10, 2026Koutian Wu, Junjie Zhou, Ergan Shang +6Artificial Intelligence BenchmarksLarge Language Model Benchmarks

  18. ΦΦ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them?

    Sep 9, 2026Leilei Ding, Shumin Wang, Yuting Huang +10Large Language Model BenchmarksInfrastructure

  19. To What Extent Do Large Language Models Understand Bangla Idioms?

    Sep 3, 2026Mousumi Akter, Md. Faiyaz Abdullah Sayeedi, Nurul Labib Sayeedi +1IdiomLarge Language Model Benchmarks

  20. Benchmarking Language Models for Statistical Problem Formulation

    Sep 2, 2026Chen Wang, Junzhe Zhao, Xin Cong +2Large Language Model BenchmarksStatistical Inference

  21. VIBE-Bench: Evaluating Personalized Large Language Models When Profiles Don't Mean Preferences

    Sep 1, 2026Yiwen Jiang, Yang Deng, Stephanie Fong +9Large Language Model PersonalizationPreference Alignment Learning

  22. Can Large Language Models Forecast What Researchers Study Next?

    Sep 1, 2026Fenghai Li, Zihan Tang, Haofei Yu +2Large Language Model ForecastingLarge Language Model Benchmarks

  23. Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation

    Aug 30, 2026Nishant Balepur, Paiheng Xu, Wei Ai +3Multiple-Choice QuestionsScoring

  24. RealisticTritonBench: A Benchmark for Triton-Kernel Generation in Real-World AI Frameworks

    Aug 12, 2026Jinjun Huang, Zhongzhen Wen, Tongtong Xu +3CudaLarge Language Model Benchmarks

  25. The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance

    Aug 12, 2026Shailja Thakur, Sungeun An, Chad DeLuca +1Large Language Model Benchmarks

  26. From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models

    Aug 11, 2026Si'an Xie, Jiaxun Liu, Biao Yang +4Large Language Model BenchmarksReasoning Skills

  27. TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

    Aug 10, 2026Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland +13Large Language Model BenchmarksData Generation

  28. LangChoiceBench: Measuring and Explaining Programming-Language Choice in LLMs

    Aug 6, 2026Lukas Twist, Twm Stone, Helen Yannakoudakis +1Large Language Model BenchmarksChoice

  29. LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs

    Aug 5, 2026Jiahao Zhang, Yongzhi Tong, Zelin Fu +4Large Language Model PersonalizationPersonalization

  30. What We Observe as LLM Behavior Can Be a Side-effect of Inference Backend

    Aug 5, 2026Shahed Masoudian, Passant Shafaei, Monorama Swain +1Large Language Model BenchmarksLLM Inference Optimization

  31. Evaluating LLMs in Database Scenarios: A Lifecycle Benchmark for Assessing Their Potential in Core Database Tasks

    Aug 4, 2026Shunfan Zheng, Dongsheng Shi, Yue Li +3Text-To-SqlLarge Language Model Benchmarks

  32. ConlangBench: Exploring Language Knowledge and Learning in LLMs through Diverse Constructed Languages

    Aug 4, 2026Jinhong Jeong, Seungyeop Yi, Sangah Lee +1Multilingual BenchmarkLarge Language Model Benchmarks

  33. Every Wrong Answer Counts: Option-Level Psychometrics for LLM Multiple-Choice Benchmarks

    Aug 3, 2026Xiao Fei, Yang Zhang, Sarah Almeida Carneiro +1Psychometric PropertiesMultiple-Choice Questions

  34. ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation

    Jul 31, 2026Gaetano Perrone, Simon Pietro RomanoMachine-Generated Text DetectionLarge Language Model Benchmarks

  35. Benchmarking Frontier Large Language Models Against Official Crash Database Coding Using Police Crash Narratives

    Jul 31, 2026Sudhir Bharati, Rajendra K C Khatri, Sudip BharatiCrashesAccidents

  36. RepBench: Compiling Benchmarks into Capability Representations for Large Language Models

    Jul 30, 2026Yanshi Li, Xueru Bai, Shuman Liu +1Large Language Model BenchmarksSynthetic Data

  37. Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement of Symbolic Discovery

    Jul 30, 2026Zhan'ao Yao, Liang Yin, Zhihao Gao +9Scientific DiscoverySynthetic Benchmark

  38. Benchmarking LLMs for Verilog Design Flows

    Jul 23, 2026Angshuman Chakravertty, Rahul Koshti, Buddhi Prakash Sharma +1High-Level SynthesisHierarchical Register Transfer Level Generation

  39. RUMBA: Russian User Memory Benchmark

    Jul 23, 2026Elizaveta Shevtsova, Inna Glebkina, Mark Baushenko +2Conversational MemoryQuestion-Answering Benchmarks

  40. KernelGenBench: Can LLMs and Agents Write Efficient Kernels Across Operator Sources and Hardware Platforms?

    Jul 22, 2026Peiyu Zang, Jian Tao, Jialing Zhang +4Graphics Processing Unit KernelsCuda

  41. SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

    Jul 21, 2026Weifeng Sun, Ye Fan, Yuchen Chen +6Code GenerationLarge Language Model Benchmarks

  42. Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

    Jul 16, 2026Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez +5Code GenerationMultilingual Benchmark

  43. GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models

    Jul 14, 2026Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim +2BanglaLarge Language Model Benchmarks

  44. AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

    Jul 13, 2026Lingkai Kong, Zijian Wu, Yuzhe Gu +11Research-Level MathematicsMathematical Reasoning Benchmarks

  45. Opti-Agent-Bench: Benchmarking End-to-End Optimization R&D Agents on Real-World Business Problems

    Jul 12, 2026Yongchang Fu, Xinjie Huang, Chengjun Dai +3Optimization ModelingAgentic Benchmarks

  46. REFORGE: A Method for Benchmarking LLMs' Reverse Engineering Capabilities in Decompiled Binary Function Naming

    Jul 7, 2026Nicolas Koller, Andreas u. SchmidtReverse EngineeringDisassembly