LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Intent2Tx: Benchmarking LLMs for Translating Natural Language Intents into Ethereum Transactions

    Apr 30, 2026Zhuoran Pan, Yue Li, Zhi Guan +2Financial ServicesLLM Evaluation

  2. From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks

    Apr 30, 2026Qingyu Ren, Tianjun Pan, Xingzhou Chen +1Reward ModelingRL for Language Models

  3. A Reproducibility Study of LLM-Based Query Reformulation

    Apr 30, 2026Amin Bigdeli, Radin Hamidi Rad, Hai Son Le +4LLM EvaluationLLM Prompting

  4. Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation

    Apr 30, 2026Jon-Paul CacioliLLM Evaluation

  5. Measurement Risk in Supervised Financial NLP: Rubric and Metric Sensitivity on JF-ICR

    Apr 30, 2026Sidi Chang, Peiying Zhu, Yuxiao Chen +1LLM EvaluationRubric-Based Evaluation

  6. LLMs Capture Emotion Labels, Not Emotion Uncertainty: Distributional Analysis and Calibration of Human-LLM Judgment Gaps

    Apr 30, 2026Keito Inoshita, Xiaokang Zhou, Akira Kawai +1LLM EvaluationAnnotator Disagreement

  7. REBENCH: A Procedural, Fair-by-Construction Benchmark for LLMs on Stripped-Binary Types and Names (Extended Version)

    Apr 30, 2026Jun Yeon Won, Xin Jin, Shiqing Ma +1LLM EvaluationSoftware Reverse Engineering

  8. When Your LLM Reaches End-of-Life: A Framework for Confident Model Migration in Production Systems

    Apr 29, 2026Emma Casey, David Roberts, David Sim +1LLM Evaluation

  9. CL-bench Life: Can Language Models Learn from Real-Life Context?

    Apr 29, 2026Shihan Dou, Yujiong Shen, Chenhao Huang +35LLM EvaluationLLM Grounding

  10. Human-in-the-Loop Benchmarking of Heterogeneous LLMs for Automated Competency Assessment in Secondary Level Mathematics

    Apr 29, 2026Jatin Bhusal, Nancy Mahatha, Aayush Acharya +1LLM EvaluationEducational Assessment

  11. Do Larger Models Really Win in Drug Discovery? A Benchmark Assessment of Model Scaling in AI-Driven Molecular Property and Activity Prediction

    Apr 29, 2026Jinjiang Guo, Sheng DingLLM EvaluationMolecular Property Prediction

  12. Beyond Accuracy: LLM Variability in Evidence Screening for Software Engineering SLRs

    Apr 29, 2026Gilberto Sussumu Hida, Danilo Monteiro Ribeiro, Erika YahataSoftware EngineeringLLM Evaluation

  13. A Systematic Comparison of Prompting and Multi-Agent Methods for LLM-based Stance Detection

    Apr 29, 2026Genan Dai, Zini Chen, Yi Yang +1Multi-Agent LLM SystemsLLM Evaluation

  14. TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

    Apr 29, 2026Han Gong, Zhen Zhou, Yunyang Shi +4LLM EvaluationIntelligent Transportation Systems

  15. BatteryPass-12K: The First Dataset for the Novel Digital Battery Passport Conformance Task

    Apr 28, 2026Tosin Adewumi, Martin Karlsson, Lama Alkhaled +1LLM Evaluation

  16. QASM-Eval: A Dataset to Train and Evaluate LLMs on OpenQASM-3 Beyond Quantum Circuits

    Apr 28, 2026Zhenxiao Fu, Lei Jiang, Fan ChenLLM EvaluationCode Generation

  17. CGU-ILALab at FoodBench-QA 2026: Comparing Traditional and LLM-based Approaches for Recipe Nutrient Estimation

    Apr 28, 2026Wei-Chun Chen, Yu-Xuan Chen, I-Fang Chung +1LLM EvaluationCost-Aware Inference

  18. Does Theory of Mind Improvement Really Benefit Human-AI Interactions? Empirical Findings from Interactive Evaluations

    Apr 28, 2026Nanxu Gong, Zixin Chen, Haotian Li +5LLM EvaluationTheory of Mind

  19. LLM-ReSum: A Framework for LLM Reflective Summarization through Self-Evaluation

    Apr 28, 2026Huyen Nguyen, Haoxuan Zhang, Yang Zhang +2LLM EvaluationLLM Self-Refinement

  20. Bye Bye Perspective API: Lessons for Building and Governing Measurement Infrastructure

    Apr 28, 2026David Hartmann, Manuel Tonneau, Angelie Kraft +7LLM EvaluationLLM Auditing

  21. SciEval: A Benchmark for Automatic Evaluation of K-12 Science Instructional Materials

    Apr 28, 2026Zhaohui Li, Peng He, Zhiyuan Chen +4LLM EvaluationAI in Education

  22. The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models

    Apr 28, 2026Abhinav Kumar Singh, Harsha Vardhan Khurdula, Yoeven D Khemlani +1LLM EvaluationLLM Information Extraction