LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

    Apr 21, 2026Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo +7LLM EvaluationLLM-as-a-Judge

  2. DW-Bench: Benchmarking LLMs on Data Warehouse Graph Topology Reasoning

    Apr 21, 2026Ahmed G. A. H Ahmed, C. Okan SakarLLM EvaluationLLM Reasoning with Graphs

  3. Assessing Capabilities of Large Language Models in Social Media Analytics: A Multi-task Quest

    Apr 21, 2026Ramtin Davoudi, Kartik Thakkar, Nazanin Donyapour +2Social Media AnalysisLLM Evaluation

  4. Personalized Benchmarking: Evaluating LLMs by Individual Preferences

    Apr 21, 2026Cristina Garbacea, Heran Wang, Chenhao TanLLM EvaluationUser Preference Modeling

  5. Experiments or Outcomes? Probing Scientific Feasibility in Large Language Models

    Apr 20, 2026Seyedali Mohammadi, Manas Gaur, Francis FerraroLLM EvaluationScientific Reasoning in Language Models

  6. FUSE: Ensembling Verifiers with Zero Labeled Data

    Apr 20, 2026Joonhyuk Lee, Virginia Ma, Sarah Zhao +4Neural Network VerificationLLM Evaluation

  7. STaD: Scaffolded Task Design for Identifying Compositional Skill Gaps in LLMs

    Apr 20, 2026Sungeun An, Swanand Ravindra Kadhe, Shailja Thakur +2LLM EvaluationReasoning Evaluation

  8. Beyond Reproduction: A Paired-Task Framework for Assessing LLM Comprehension and Creativity in Literary Translation

    Apr 20, 2026Ran Zhang, Steffen Eger, Arda Tezcan +3Creativity AssessmentLLM Evaluation

  9. Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks

    Apr 20, 2026Jin Zhao, Marta Knežević, Tanja KäserLLM EvaluationIntelligent Tutoring Systems

  10. How Creative Are Large Language Models in Generating Molecules?

    Apr 20, 2026Wen Tao, Yiwei Wang, Peng Zhou +6Creativity AssessmentLLM Evaluation

  11. Employing General-Purpose and Biomedical Large Language Models with Advanced Prompt Engineering for Pharmacoepidemiologic Study Design

    Apr 20, 2026Xinyao Zhang, Nicole Sonne Heckmann, Manuela Del Castillo Suero +2LLM EvaluationHealthcare

  12. ltzGLUE: Luxembourgish General Language Understanding Evaluation

    Apr 20, 2026Alistair Plum, Felicia Körner, Anne-Marie Lutgen +8LLM EvaluationText Classification

  13. From Fallback to Frontline: When Can LLMs be Superior Annotators of Human Perspectives?

    Apr 20, 2026Hasan Amin, Harry Yizhou Tian, Xiaoni Duan +3LLM EvaluationLLM-Assisted Annotation

  14. QuickScope: Certifying Hard Questions in Dynamic LLM Benchmarks

    Apr 20, 2026Taylor Lundy, Narun K. Raman, Kevin Leyton-BrownLLM EvaluationBayesian Optimization

  15. SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL Benchmarks

    Apr 20, 2026Mohammadtaher Safarzadeh, Hitesh Laxmichand Patel, Afshin Orojlooyjadid +2LLM EvaluationBenchmark Contamination

  16. Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks

    Apr 20, 2026Rongyuan Tan, Jue Zhang, Zhuozhao Li +3LLM EvaluationFeature Attribution

  17. MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models

    Apr 20, 2026Suhyun Lee, Palakorn Achananuparp, Neemesh Yadav +2Mental Health CounselingLLM Evaluation

  18. Measuring Distribution Shift in User Prompts and Its Effects on LLM Performance

    Apr 19, 2026Parker Seegmiller, Sarah Masud PreumLLM EvaluationInstruction Following

  19. KnowledgeBerg: Evaluating Systematic Knowledge Coverage and Compositional Reasoning in Large Language Models

    Apr 19, 2026Xiao Zhang, Qianru Meng, Yongjian Chen +2LLM EvaluationCompositional Reasoning

  20. Evaluating Hallucinations in Domain-Adapted Large Language Models

    Apr 19, 2026Sanchita Porwal, Sai Prasath S, Xingjian Bi +1LLM EvaluationDomain Adaptation

  21. ArgBench: Benchmarking LLMs on Computational Argumentation Tasks

    Apr 19, 2026Yamen Ajjour, Carlotta Quensel, Nedim Lipka +1LLM EvaluationArgument Mining