LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. Challenges of Auditing: Variability in Outputs of Large Language Models for Health

    Sep 15, 2026Yuan Pu, Yewon Chang, Furong Jia +4LLM EvaluationLLM Auditing

  2. Competence-Preserving Resume Perturbations Expose Presentation Sensitivity in LLM Screening

    Sep 15, 2026Qiangju Chen, Yang XiaoLLM EvaluationLanguage Model Robustness

  3. Before You Poll with LLMs: A Deliberative Diagnostic Framework

    Sep 14, 2026Ahmed Wali, Hassaan TayyabLLM EvaluationPolitical Bias in Language Models

  4. Are LLMs Good Financial User Simulators? A Preliminary Study

    Sep 14, 2026Jiajie He, Jiangyuan Hong, Dongling Ni +2LLM EvaluationHuman Behavior Simulation

  5. Can We Trust the Judges? Validation of Factuality Evaluation Methods via Answer Perturbation

    Sep 14, 2026Sarra Gharsallah, Adele Robaldo, Mariia Tokareva +5LLM EvaluationLLM-as-a-Judge

  6. Authorship attribution and aesthetic evaluation of AI poetry: a case study with Haiku

    Sep 14, 2026Livia Oddi, Simone Scardapane, Toru Sugimoto +1LLM EvaluationAI-Generated Text Detection

  7. Turkish MMLU Pro: Traceable Option Augmentation and Its Validity Limits in Turkish Multiple-Choice Evaluation

    Sep 14, 2026M. Ali BayramMultilingual Language Model EvaluationLLM Evaluation

  8. Empirical Evaluation of Open-Source Large Language Models for Retrieval-Augmented Generation in ESG Domain

    Sep 14, 2026Motaz Saad, Anna Borrelli, Ivan Gentile +3LLM EvaluationLLM Grounding

  9. SALUTE: Benchmarking and Adapting LLMs for the Defense Domain

    Sep 14, 2026Hyeongcheol Park, Sumin In, Suyeon Myeong +5LLM EvaluationDomain-Adaptive Pretraining

  10. Can We Trust LLM Judges: A Study of Capability-Dependent Biases and Multi-Judge Ensemble for Bias Calibration

    Sep 14, 2026Gemma Zhang, Prachi Badarayani, Asmi Kumar +2LLM EvaluationLLM-as-a-Judge

  11. ORQA: An Occupation-Realistic Question and Answer Framework for LLM Professional Knowledge

    Sep 14, 2026Shreyas Krishnan, Serina Chang, Abhishek NagarajLLM EvaluationFactual Knowledge in Language Models

  12. Zipbench: Low-Cost Framework for Compressing Comprehensive Benchmarks of Large Language Models

    Sep 14, 2026Zhongzhan Huang, Junxin Li, Guoming Ling +3LLM Evaluation

  13. Judging by the Cover: Cleaning LLM Truthfulness Benchmarks to Avoid Surface-Level Feature Leakage

    Sep 14, 2026Foad Namjoo, Remy Ogasawara, Amirali Abdullah +3Data LeakageLLM Evaluation

  14. Biomedical Reference Generation Remains Unreliable across 26 Large Language Models

    Sep 14, 2026Maxim Topaz, Zhihong Zhang, Nir Roguin +3LLM EvaluationHallucination in Language Models

  15. One Example Is Enough to Pass Fairness Benchmarks: Rethinking Fairness Evaluation for Aligned LLMs

    Sep 14, 2026Naihao Deng, Samee Arif, Shuaichen Chang +2LLM EvaluationLLM Alignment

  16. A primer on evaluation methods for large language models in healthcare

    Sep 13, 2026Suzannah E McKinney, Phuc Vu, Samuel A Justice +7LLM EvaluationClinical Language Model Evaluation

  17. Measuring the Creativity of Frontier LLMs in Automated Research

    Sep 12, 2026Yiheng Zhao, Mengzhuo Chen, Chengming Hu +3Creativity AssessmentLLM Evaluation

  18. IBBench-Light: A Paired Evaluation of Task-Conditioned Responses to External Directives

    Sep 12, 2026Kainan Zhou, Zhaoyi Li, Janet Sung +2LLM EvaluationBenchmark Design

  19. Does Linguistic Structure Enrichment Enhance Coherence Assessment? Not With Current Architectures

    Sep 12, 2026Victor Mazzotti, Luiz Pereira, Marina Bitencourt dos Santos +4LLM Evaluation

  20. NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment

    Sep 12, 2026Guoqiang Zhang, Kexin Tan, Ming Zhang +12LLM EvaluationLLM Answer Verification

  21. The widening evaluation gap in medical large language model research 2023 to 2026

    Sep 11, 2026Raad Bin Tareaf, Murad Al-Rajab, Samia LoucifLLM EvaluationClinical Language Model Evaluation

  22. On the Impact of Anonymization on the Performance of Large Language Models

    Sep 10, 2026Tobias Deußer, Max Hahnbück, Lorenz Sparrenberg +3LLM EvaluationPrivacy-Preserving Language Models

  23. SemVerBench: Benchmarking LLM Comprehension of Version-Constraint Resolution Semantics

    Sep 10, 2026Qibai Chen, Zeming LiuSoftware EngineeringLLM Evaluation

  24. Quantifying Logical Consistency in Transformers via Query-Key Alignment

    Sep 10, 2026Eduard Tulchinskii, Anastasia Voznyuk, Laida Kushnareva +4Transformer InterpretabilityLLM Evaluation