LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. V4FinBench: Benchmarking Tabular Foundation Models, LLMs, and Standard Methods on Corporate Bankruptcy Prediction

    May 11, 2026Marcin Kostrzewa, Sebastian Tomczak, Roman Furman +5Class-Imbalanced LearningTabular Foundation Models

  2. AssayBench: An Assay-Level Virtual Cell Benchmark for LLMs and Agents

    May 11, 2026Edward De Brouwer, Carl Edwards, Alexander Wu +9LLM EvaluationAI Agent Benchmarks

  3. Generalizing the Turing Test to Interactive Agents

    May 11, 2026Daniel Mitropolsky, Riccardo Neumarker, Emanuele Rimoldi +2LLM EvaluationAI Agent Evaluation

  4. Likelihood scoring for continuations of mathematical text: a self-supervised benchmark with tests for shortcut vulnerabilities

    May 11, 2026Daniel RanardLLM EvaluationNext-Token Prediction

  5. Measuring Embedding Sensitivity to Authorial Style in French: Comparing Literary Texts with Language Model Rewritings

    May 11, 2026Benjamin Icard, Lila Sainero, Alice Breton +2LLM EvaluationText Embeddings

  6. LLM Jaggedness Unlocks Scientific Creativity

    May 11, 2026Shray Mathur, J. Anibal Boscoboinik, Esther H. R. Tsai +1Creativity AssessmentLLM Evaluation

  7. Can Language Models Analyze Data? Evaluating Large Language Models for Question Answering over Datasets

    May 11, 2026Andreas Xenofontos, Pavlos FafaliosTable QALLM Evaluation

  8. Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization

    May 11, 2026Elad Tolochinsky, Yaniv Tenzer, Yaniv RomanoModel SelectionMulti-Armed Bandits

  9. Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness

    May 11, 2026Ivo Petrov, Jasper Dekoninck, Dimitar I. Dimitrov +1Mathematical Reasoning BenchmarksLLM Evaluation

  10. LLM-Based Code Documentation Generation and Multi-Judge Evaluation

    May 11, 2026Ikbel Ghrab, Mohamed Dhieb, Ismail Khenissi +1LLM EvaluationLLM-as-a-Judge

  11. IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs

    May 11, 2026Songlin Bai, Xintong Wang, Linlin Yu +12LLM EvaluationQuestion Answering

  12. LegalCiteBench: Evaluating Citation Reliability in Legal Language Models

    May 11, 2026Sijia Chen, Hang Yin, Shunfan ZhouLLM EvaluationLegal IR

  13. Active Testing of Large Language Models via Approximate Neyman Allocation

    May 11, 2026Zeli Liu, Jiancheng Zhang, Cong Liu +1LLM EvaluationLanguage Model Generation Evaluation

  14. PlantMarkerBench: A Multi-Species Benchmark for Evidence-Grounded Plant Marker Reasoning

    May 11, 2026Sajib Acharjee Dip, Song Li, Liqing ZhangLLM EvaluationEvidence-Grounded Reasoning

  15. TeleResilienceBench: Quantifying Resilience for LLM Reasoning in Telecommunications

    May 11, 2026Pranshav Gajjar, Emmanuel Ojo, Vijay K ShahLLM EvaluationLLM Reasoning

  16. NaiAD: Initiate Data-Driven Research for LLM Advertising

    May 11, 2026Yihang Zhang, Zimeng Huang, Ren Zhai +2LLM EvaluationOnline Advertising

  17. Calibrate, Don't Curate: Label-Efficient Estimation from Noisy LLM Judges

    May 10, 2026Yanran LiLLM EvaluationLLM-as-a-Judge

  18. Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities

    May 10, 2026Ryan Albright, Golam Md Muktadir, Zarif Ikram +3LLM EvaluationLanguage Model Robustness

  19. TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning

    May 10, 2026Yize Li, Junzhi Li, Jason Song +3LLM EvaluationTool-Use Evaluation

  20. An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning

    May 10, 2026Yikun Li, Jinfeng Jiang, Ting Zhang +7LLM EvaluationCode Language Models

  21. Beyond Accuracy: Evaluating Strategy Diversity in LLM Mathematical Reasoning

    May 10, 2026Xia Yang, Xuanyi Zhang, Hao Hu +1Mathematical Reasoning BenchmarksLLM Evaluation

  22. Beyond Continuity: Challenges of Context Switching in Multi-Turn Dialogue with LLMs

    May 10, 2026Aditya Sinha, Harald Steck, Vito Ostuni +1LLM EvaluationMulti-Turn Dialogue Evaluation

  23. Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain

    May 9, 2026Xiaoyu Hu, Jinman ZhaoLLM EvaluationSocial Bias in Language Models

  24. Re2^2Math: Benchmarking Theorem Retrieval in Research-Level Mathematics

    May 9, 2026Zicheng Lyu, Wenjie Yang, Shengzhong Zhang +1Mathematical Reasoning BenchmarksLLM Evaluation

  25. Decomposing and Steering Functional Metacognition in Large Language Models

    May 9, 2026Yanshi Li, Xueru Bai, Shuman Liu +2LLM EvaluationLLM Interpretability

  26. Narrative Landscape: Mapping Narrative Dispositions Across LLMs

    May 9, 2026Donghoon Jung, Jiwoo Choi, Songeun Chae +1LLM Evaluation

  27. PrepBench: How Far Are We from Natural-Language-Driven Data Preparation?

    May 9, 2026Jingzhe Xu, Rui Wang, Jiannan Wang +1LLM EvaluationLLM Code Generation