LLM Evaluation

LLM: Large Language Model

Latest papers 1,610

All topics
CardsList
  1. Agreement Is Not Validity: Cross-Model LLM Consensus in Diagnosing Student Failure Modes in K-12 Math Tutoring Dialogue

    Oct 6, 2026Clayton Cohn, Joyce Fonteles, Kirk Vanacore +5LLM EvaluationLLM-Assisted Annotation

  2. Penalty-Framed No-Valid-Option MCQA: Analyzing LLM Abstention under Invalid Choices

    Oct 6, 2026Jinhyeok Kim, Hye-Young JungLLM EvaluationMultiple-Choice Question Answering

  3. The Labeling Problem in Hallucination Detection Benchmarks: An Empirical Evaluation

    Oct 6, 2026Jorma Valjakka, Juhani Kivimäki, Juha Mylläri +1LLM EvaluationLLM-as-a-Judge

  4. Rethinking Faithfulness in LLMs: A Pairwise Context-Sensitive Perspective

    Oct 6, 2026Zizhuo Zhang, Xiong Peng, Jingwei Sun +3Contextual FaithfulnessLLM Evaluation

  5. Does Steering Break Your Model? A Multi-Dimensional Evaluation Suite for LLM Steering Methods

    Oct 6, 2026Haotian Yang, Huikang Jiang, Yucheng Wu +4LLM EvaluationLanguage Model Steering

  6. HouseholdBench: Evaluating Large Language Models as Predictors of Household Economic Behavior

    Oct 6, 2026Jin Huang, Diego Ferreras Garrucho, Yutong Xie +4LLM EvaluationLLM Fine-Tuning

  7. What pass@k Cannot Measure: Evaluating Diversity and Capability Retention after Post-Training

    Oct 5, 2026Subham Rath, Raj Dandekar, Rajat Dandekar +1LLM EvaluationLanguage Model Generation Evaluation

  8. Dynamic Budget Allocation for LLM Evaluation under Hard Resource Constraints

    Oct 5, 2026Shai Feldman, Yaniv RomanoLLM EvaluationLLM Safety Evaluation

  9. JEV versus LLMs: Accuracy, Cost and Calibration on Seven Political Science Replications

    Oct 5, 2026Steven Denney, Matthew DiGiuseppeLLM EvaluationComputational Social Science

  10. FREA: A Multi-Source Expert Benchmark for Reaction Feasibility Verification

    Oct 5, 2026Botao Yu, Bo Zhou, Daniel Adu-Ampratwum +7LLM EvaluationAI-Assisted Scientific Research

  11. Will the Judge Flip? Predicting Position-Sensitive LLM Judgments from Residual Stream Activations

    Oct 5, 2026Hashmath Shaik, Gnaneswar Villuri, Alex DoboliLLM EvaluationLLM-as-a-Judge

  12. JudgeMoE: Distributional Aggregation for LLM-as-a-Judge

    Oct 5, 2026Yiqi Liu, Joseph James, Yang Wang +3LLM EvaluationLLM-as-a-Judge

  13. GraphDecide: Benchmarking System One Models on Graph Tasks

    Oct 5, 2026Xianliang Yang, Yapu Zhang, Li ZhaoLLM EvaluationLLM Reasoning with Graphs

  14. Breaking Bureaucracy: Evaluating open-source LLMs for legal document review

    Oct 5, 2026Farrukh Baratov, Niki van Stein, Suzan VerberneZero-Shot LearningLegal NLP

  15. MS-Exam-Gen: Source-Grounded Benchmark Construction for Evaluating LLMs on Textual Multiple Sclerosis MRI Knowledge

    Oct 5, 2026Abdul Basit, Muhammad Abdullah Hanif, Muhammad ShafiqueLLM EvaluationSynthetic Benchmark Generation

  16. Knowing the Rules, Applying the Rules: Evaluating Language Models on Traditional Chinese Bazi

    Oct 5, 2026Jiulin Li, Ping HuangLLM EvaluationCultural Knowledge in Language Models

  17. Dataset Signatures in Human-LLM Interactions and User Modeling

    Oct 4, 2026Joseph Suh, Serina ChangLLM EvaluationUser Modeling

  18. What Does a Harness Repair? A Preregistered Study of Visibility, Baseline Adequacy and Evaluation Defects

    Oct 4, 2026Bowen Xu, Boyu ChenLLM EvaluationBenchmark Validity

  19. GNN-CB: A Graph Neural Network Competition Benchmark for Human and LLM Evaluation

    Oct 4, 2026Murad Hossen, Tasneem Selim, Gurur Gamgam +22LLM EvaluationGraph Neural Networks

  20. VHDL-REPOBENCH: A Repository-Level Benchmark for Evaluating Large Language Models on VHDL Design Generation

    Oct 4, 2026Prashanth Vijayaraghavan, Akul Malhotra, Ashutosh Jadhav +2LLM EvaluationCode Generation

  21. When Verifiable Counts Depend on Wording: Auditing Wording Robustness in Instruction Following

    Oct 4, 2026Qishi Zhan, Seoyeon Jang, Zihan Dong +3LLM EvaluationInstruction Following

  22. How Much Do LLM-as-a-Judge Design Choices Matter? A Systematic Comparison of Prompt Designs, Rating Scales, and Models

    Oct 4, 2026Laurène Vaugrante, Thilo HagendorffLLM EvaluationLLM-as-a-Judge

  23. Where LLMs Fail with Visualization DSLs

    Oct 1, 2026Chang Han, Andrew McNutt, Katherine IsaacsData VisualizationLLM Evaluation

  24. Which LLM to pick? Online Active Model Selection for Large Language Models

    Oct 1, 2026Alessandro Turrin, Patrik Okanovic, Torsten Hoefler +1Model SelectionLLM Evaluation

  25. Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs

    Oct 1, 2026Nagham Omar, Mahmoud Jabarin, Maya Rozenshtein +3Prompt SensitivityLLM Evaluation

  26. What Wins a Vote? Formatting, Length, and Lexical Diversity in the French Compar:IA LLM Arena

    Oct 1, 2026Simonas Zilinskas, Maayeesha Farzana, Christophe BenaventLLM Evaluation

  27. Evaluating the Robustness of Japanese LLMs to IME-Related and Typographical Errors

    Oct 1, 2026Ryota Mibayashi, Hiroaki OhshimaLLM EvaluationLanguage Modeling

  28. How Much Can Language Models Gain from Test-Time Computation?

    Oct 1, 2026Bangji Yang, Jingyuan Li, Jiajun Fan +8LLM EvaluationTest-Time Scaling

  29. Evaluating LLM-Generated Preference Distributions

    Oct 1, 2026Fan Huang, Minsuk Kim, C. Tyler Diggans +1LLM EvaluationSynthetic Data Generation

  30. A Citation-Grounded Benchmark for Trustworthy Earnings Call Transcript Analysis with Large Language Models

    Oct 1, 2026Yingzhu Zhao, Vlad Pandelea, Han Yuan +4LLM EvaluationFinancial QA

  31. How Divergence Becomes Decision Flips in Compressed Language Models

    Sep 30, 2026Beatriz Almeida FelicioLLM EvaluationLLM Compression

  32. Ontology-Grounded, Reasoner-Verified Benchmarks for Evaluating LLM Reasoning in Scientific AI

    Sep 30, 2026Nishtha N. Vaidya, Stephan Grimm, Thomas Hubauer +1LLM EvaluationSynthetic Benchmark Generation

  33. On the (In)effectiveness of AMR Augmentation for Large Language Models

    Sep 30, 2026Hoa Quynh Nhung Nguyen, Jacopo Staiano, Michael SullivanLLM EvaluationKnowledge Augmentation for Language Models

  34. Benchmarking Prompt Optimization of Large Language Models With Chess

    Sep 30, 2026Timothée Lesort, Alejandra López de Aberasturi Gómez, Tristan Karch +4LLM EvaluationAutomatic Prompt Optimization

  35. ArchitectureIQ: On the Measure of Training Intuition

    Sep 30, 2026Zirui Ren, Shaoyang Guo, Chencheng Tang +9Model SelectionLLM Evaluation

  36. LLM-as-a-Judge for Low-Resource Languages: Adapting Ragas and Comparative Ranking for Romanian

    Sep 30, 2026Claudiu Creanga, Liviu P. DinuLLM EvaluationLLM-as-a-Judge

  37. Who Owns That? Evaluating Ownership Intuitions in Large Language Models

    Sep 30, 2026Xizhi Xiao, Yue Wu, Shan Xu +1LLM Evaluation

  38. RAIM: Robust Aggregation of Inexpensive Models for Hallucination Detection

    Sep 30, 2026Elia Onofri, Roberto Di PietroLLM EvaluationLLM-as-a-Judge

  39. A Shared Taste for Model-Written Text: The Generator-by-Selector Matrices of "AI-AI Bias" Show No Detectable Own-Model Premium

    Sep 30, 2026Dmitrij ŻatuchinLLM EvaluationLanguage Model Bias Evaluation

  40. Right Answers, Costly Models: The Efficiency Gap in LLM-based Optimization Modeling

    Sep 30, 2026Zhong Li, Xin Huang, Jinhui Wan +6LLM EvaluationLarge Language Model-Guided Optimization

  41. Where MLLMs Fail and Why: Causal Task Decomposition for Capability Failure Diagnosis

    Sep 30, 2026Xia Hu, Brian Potetz, Chun-Ta Lu +6LLM EvaluationCounterfactual Evaluation of VLMs

  42. More Choices, Fewer Decisions: Ordinal-Scale Bias in JEV-like Direct-Decision Models

    Sep 30, 2026Tianxiang Gao, Jinzhe Li, Zhiyuan Li +2LLM EvaluationOrdinal Regression

  43. StreamDecisionBench: Evaluating Decisions in Force on Evolving Language Streams

    Sep 29, 2026Jhen-Ke Lin, Chung Chun WangLLM EvaluationLLM Inference

  44. ArgGYM: A Procedural, Engine-Verified Benchmark for Structured Defeasible Reasoning

    Sep 29, 2026İbrahim Ethem Deveci, Funda Tan Çalık, Barış Deniz Sağlam +1LLM EvaluationRL for Language Model Reasoning

  45. Halluscoring 2026: The first shared task on llms hallucination detection and answer verification

    Sep 29, 2026Aisha Alansari, Abdessalam Bouchekif, Ahmed Hasanaath +9LLM EvaluationLLM Answer Verification

  46. CARAT: Do Materials LLMs Reason or Recite?

    Sep 29, 2026Jiajun Wu, Jian Yang, Zixiang Ni +2LLM EvaluationLLM Grounding

  47. Evaluating and Benchmarking the System One Model Jev

    Sep 29, 2026Tobias Deußer, Lorenz Sparrenberg, Rafet SifaMultilingual Language Model EvaluationLLM Evaluation