LLM Evaluation

LLM: Large Language Model

Latest papers 1,610

All topics
CardsList
  1. Beyond Imitation: A Framework and Benchmark for LLM-Assisted Peer Review

    Oct 8, 2026Rachel S. Y. Teo, Yutaro Yamada, Shashank Kotyan +2Automated Peer ReviewLLM Evaluation

  2. Validity Without Ground Truth: What Stated-Preference Economics Offers the Evaluation of Language Models

    Oct 7, 2026Daniel Robert Kling Alexander, Catherine Louise KlingLLM Evaluation

  3. Nobody Truly Agrees on Sentiment: Humans, Bespoke Tools, and LLMs Struggle with Social Media Texts

    Oct 7, 2026Himarsha R. Jayanetti, Sivakanesan Dhanushkanda, Shuai Hao +2Sentiment AnalysisSocial Media Analysis

  4. LLM Persuasion Is in the Eye of the Evaluation

    Oct 7, 2026Kamile Dementaviciute, Julija Vaitonyte, Tijl De BiePersuasion in Language ModelsLLM Evaluation

  5. Reproducible LLM Inference Benchmarking: A Sequential Isolation Protocol for Regression Testing

    Oct 7, 2026Arnold Olympio, Juan Manuel Servera Bondroit, Wael Abdelmalek +2LLM InferenceML Reproducibility

  6. InsClaimBench: Benchmarking Insurance Claim Adjudication Across the Decision Chain

    Oct 7, 2026Linqi Zhang, Chong Qi, Yan Cheng +4AI-Assisted Decision MakingLLM Evaluation

  7. Alice: A Large-Scale German Benchmark for Rubric-Based Multi-Dimensional Automatic Short Answer Scoring

    Oct 7, 2026Zhifan Sun, Sebastian Gombert, Jannik Lossjew +6Automated GradingEducational Assessment

  8. How Do LLMs Change Predictions Under Negation?

    Oct 7, 2026Jongwook Yoon, Jongwon Lim, Sungjib Lim +2LLM ReliabilityLLM Evaluation

  9. RELATE: An Evaluation Framework for measuring Relational Orientation of Large Language Models

    Oct 7, 2026Shivam Shukla, Jihye Kim, Shubham Gaur +2LLM EvaluationEmotional Support Conversation

  10. MARS: Malware Analysis with Rule-Based Scoring of LLM Claims

    Oct 7, 2026Hyeongjun ChoiMalware ClassificationLLMs for Cybersecurity

  11. Arctic Questions, Missing Answers: A Dataset and Benchmark for LLM Abstention in Arctic Science

    Oct 7, 2026Benjamin Wilcox, Dawei Gao, Pradeeban Kathiravelu +3LLM AbstentionLLM Evaluation

  12. Conditional Accuracy Profiles: Diagnosing LLM Judges across Deployment Conditions

    Oct 6, 2026Wenqi Li, Bin Liu, Mindi Ruan +3LLM EvaluationLLM-as-a-Judge

  13. sk-bench: A Native-First Benchmark for Evaluating Large Language Models in Slovak

    Oct 6, 2026Marek Šuppa, Ivan Vykopal, Andrej Ridzik +9LLM EvaluationMultilingual Language Model Evaluation

  14. Agreement Is Not Validity: Cross-Model LLM Consensus in Diagnosing Student Failure Modes in K-12 Math Tutoring Dialogue

    Oct 6, 2026Clayton Cohn, Joyce Fonteles, Kirk Vanacore +5LLM EvaluationLLM-Assisted Annotation

  15. Penalty-Framed No-Valid-Option MCQA: Analyzing LLM Abstention under Invalid Choices

    Oct 6, 2026Jinhyeok Kim, Hye-Young JungLLM EvaluationMultiple-Choice Question Answering

  16. The Labeling Problem in Hallucination Detection Benchmarks: An Empirical Evaluation

    Oct 6, 2026Jorma Valjakka, Juhani Kivimäki, Juha Mylläri +1LLM EvaluationLLM-as-a-Judge

  17. Rethinking Faithfulness in LLMs: A Pairwise Context-Sensitive Perspective

    Oct 6, 2026Zizhuo Zhang, Xiong Peng, Jingwei Sun +3Contextual FaithfulnessLLM Evaluation

  18. OTel: Open Telco AI Datasets, Benchmarks, and Models

    Oct 6, 2026Farbod Tavakkoli, Gregory Diamos, Kenneth Church +15Language Model Post-TrainingLLM Reranking

  19. Does Steering Break Your Model? A Multi-Dimensional Evaluation Suite for LLM Steering Methods

    Oct 6, 2026Haotian Yang, Huikang Jiang, Yucheng Wu +4LLM EvaluationLanguage Model Steering

  20. HouseholdBench: Evaluating Large Language Models as Predictors of Household Economic Behavior

    Oct 6, 2026Jin Huang, Diego Ferreras Garrucho, Yutong Xie +4LLM EvaluationLLM Fine-Tuning

  21. What pass@k Cannot Measure: Evaluating Diversity and Capability Retention after Post-Training

    Oct 5, 2026Subham Rath, Raj Dandekar, Rajat Dandekar +1LLM EvaluationLanguage Model Generation Evaluation

  22. Dynamic Budget Allocation for LLM Evaluation under Hard Resource Constraints

    Oct 5, 2026Shai Feldman, Yaniv RomanoLLM EvaluationLLM Safety Evaluation

  23. JEV versus LLMs: Accuracy, Cost and Calibration on Seven Political Science Replications

    Oct 5, 2026Steven Denney, Matthew DiGiuseppeLLM EvaluationComputational Social Science

  24. FREA: A Multi-Source Expert Benchmark for Reaction Feasibility Verification

    Oct 5, 2026Botao Yu, Bo Zhou, Daniel Adu-Ampratwum +7LLM EvaluationAI-Assisted Scientific Research

  25. Will the Judge Flip? Predicting Position-Sensitive LLM Judgments from Residual Stream Activations

    Oct 5, 2026Hashmath Shaik, Gnaneswar Villuri, Alex DoboliLLM EvaluationLLM-as-a-Judge

  26. JudgeMoE: Distributional Aggregation for LLM-as-a-Judge

    Oct 5, 2026Yiqi Liu, Joseph James, Yang Wang +3LLM EvaluationLLM-as-a-Judge

  27. GraphDecide: Benchmarking System One Models on Graph Tasks

    Oct 5, 2026Xianliang Yang, Yapu Zhang, Li ZhaoLLM EvaluationLLM Reasoning with Graphs

  28. Breaking Bureaucracy: Evaluating open-source LLMs for legal document review

    Oct 5, 2026Farrukh Baratov, Niki van Stein, Suzan VerberneZero-Shot LearningLegal NLP

  29. MS-Exam-Gen: Source-Grounded Benchmark Construction for Evaluating LLMs on Textual Multiple Sclerosis MRI Knowledge

    Oct 5, 2026Abdul Basit, Muhammad Abdullah Hanif, Muhammad ShafiqueLLM EvaluationSynthetic Benchmark Generation

  30. Knowing the Rules, Applying the Rules: Evaluating Language Models on Traditional Chinese Bazi

    Oct 5, 2026Jiulin Li, Ping HuangLLM EvaluationCultural Knowledge in Language Models

  31. Dataset Signatures in Human-LLM Interactions and User Modeling

    Oct 4, 2026Joseph Suh, Serina ChangLLM EvaluationUser Modeling

  32. What Does a Harness Repair? A Preregistered Study of Visibility, Baseline Adequacy and Evaluation Defects

    Oct 4, 2026Bowen Xu, Boyu ChenLLM EvaluationBenchmark Validity

  33. GNN-CB: A Graph Neural Network Competition Benchmark for Human and LLM Evaluation

    Oct 4, 2026Murad Hossen, Tasneem Selim, Gurur Gamgam +22LLM EvaluationGraph Neural Networks

  34. VHDL-REPOBENCH: A Repository-Level Benchmark for Evaluating Large Language Models on VHDL Design Generation

    Oct 4, 2026Prashanth Vijayaraghavan, Akul Malhotra, Ashutosh Jadhav +2LLM EvaluationCode Generation

  35. When Verifiable Counts Depend on Wording: Auditing Wording Robustness in Instruction Following

    Oct 4, 2026Qishi Zhan, Seoyeon Jang, Zihan Dong +3LLM EvaluationInstruction Following

  36. How Much Do LLM-as-a-Judge Design Choices Matter? A Systematic Comparison of Prompt Designs, Rating Scales, and Models

    Oct 4, 2026Laurène Vaugrante, Thilo HagendorffLLM EvaluationLLM-as-a-Judge

  37. Where LLMs Fail with Visualization DSLs

    Oct 1, 2026Chang Han, Andrew McNutt, Katherine IsaacsData VisualizationLLM Evaluation

  38. Which LLM to pick? Online Active Model Selection for Large Language Models

    Oct 1, 2026Alessandro Turrin, Patrik Okanovic, Torsten Hoefler +1Model SelectionLLM Evaluation

  39. Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs

    Oct 1, 2026Nagham Omar, Mahmoud Jabarin, Maya Rozenshtein +3Prompt SensitivityLLM Evaluation

  40. What Wins a Vote? Formatting, Length, and Lexical Diversity in the French Compar:IA LLM Arena

    Oct 1, 2026Simonas Zilinskas, Maayeesha Farzana, Christophe BenaventLLM Evaluation

  41. Evaluating the Robustness of Japanese LLMs to IME-Related and Typographical Errors

    Oct 1, 2026Ryota Mibayashi, Hiroaki OhshimaLLM EvaluationLanguage Modeling

  42. How Much Can Language Models Gain from Test-Time Computation?

    Oct 1, 2026Bangji Yang, Jingyuan Li, Jiajun Fan +8LLM EvaluationTest-Time Scaling

  43. Evaluating LLM-Generated Preference Distributions

    Oct 1, 2026Fan Huang, Minsuk Kim, C. Tyler Diggans +1LLM EvaluationSynthetic Data Generation

  44. A Citation-Grounded Benchmark for Trustworthy Earnings Call Transcript Analysis with Large Language Models

    Oct 1, 2026Yingzhu Zhao, Vlad Pandelea, Han Yuan +4LLM EvaluationFinancial QA

  45. How Divergence Becomes Decision Flips in Compressed Language Models

    Sep 30, 2026Beatriz Almeida FelicioLLM EvaluationLLM Compression