LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Modeling Memory-Dependent Reliability of LLMs: A Hidden Markov Model

    Jul 24, 2026Robab Aghazadeh Chakherlou, Siddartha Khastgir, Peter Popov +1LLM EvaluationHierarchical Bayesian Modeling

  2. Do Coverage and Mutation Scores of LLM-Generated Test Suites Correlate with Their Effectiveness? (Replicability Study)

    Jul 24, 2026Junda Zhao, Shurui Zhou, Eldan CohenLLM EvaluationAutomated Software Testing

  3. Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science

    Jul 24, 2026Davide Scarso, Hugo Noronha de Almeida, Joaquim PinaLLM EvaluationLLM Auditing

  4. Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity

    Jul 24, 2026Pengzhao Lyu, Yeun Joon Kim, Hanlin Xiao +1Creativity AssessmentLLM Evaluation

  5. NL2SHACL-Bench: A Benchmark Suite for Natural Language to SHACL Translation

    Jul 24, 2026Yuchen Zhou, Niels Bobet, Maribel AcostaLLM EvaluationKnowledge Graphs

  6. WuYuEval: A Multi-Level Benchmark for Large Language Models in Solid Waste Management

    Jul 24, 2026Yi Zhang, Hongyang Wang, Zheng Hao Leong +11LLM Evaluation

  7. On Improving Faithfulness of Podcasts from Documents

    Jul 24, 2026Soumya Dutta, Tejas Indulal Dhamecha, Pannaga ShivaswamyContextual FaithfulnessLLM Evaluation

  8. One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies

    Jul 23, 2026Minh Ngoc Ta, My Anh Tran Nguyen, Duong D. Nguyen +2LLM EvaluationClarification Question Generation

  9. Reexamining zero-shot summarization: Empirical investigation of trustworthiness of LLM-summarizers

    Jul 23, 2026Vasudha Bhatnagar, Purnima Bindal, Vikas Kumar +1LLM EvaluationText Summarization

  10. Profiling Lightweight Large Language Models

    Jul 23, 2026Tomohiro Harada, Enrique Alba, Gabriel LuqueLLM Inference EfficiencyLLM Evaluation

  11. Evaluating Large Language Models for Symbolic Security Protocol Analysis

    Jul 22, 2026Paolo Modesti, Syed Ahmed, Ioannis Sfyrakis +1LLM EvaluationCybersecurity

  12. WaveformQA: Benchmarking LLM Temporal Reasoning on Digital Waveforms

    Jul 22, 2026Yichuan Liu, Daniel Cummings, Nick VadlamudiLLM EvaluationTime Series QA

  13. Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups

    Jul 22, 2026Haran Shani-Narkiss, Michael Fire, Oren TsurLLM EvaluationLLM Alignment

  14. Which Values Do LLMs Confuse? A Schwartz-Based Recognition Study

    Jul 22, 2026Andrei Chetvergov, Stepan Ukolov, Timofei Sivoraksha +5LLM EvaluationMoral Reasoning in Language Models

  15. Co-Evolving LLM Evaluators and Policies via DynamicRubric

    Jul 22, 2026Beining Wang, Weihang Su, Hongtao Tian +8RL for Language ModelsLLM Evaluation

  16. D2VBench: Benchmarking Large Language Models with Value Dilemmas in Daily Scenarios

    Jul 22, 2026Siyi Hao, Yidi Cao, Linhao Yu +2LLM EvaluationLLM Alignment

  17. Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements

    Jul 22, 2026Xinke Tong, Xuanming Zhang, Tianyi Tang +10Numerical Reasoning in Language ModelsLLM Evaluation

  18. Task Competence Is Not Instruction Following: Evaluating Instruction-Conflicting Behavior in Small Language Models

    Jul 21, 2026Mahdiyeh Farajidizaji, Vatsal RainaLLM EvaluationInstruction Following

  19. Total Variation Distance Estimation in Autoregressive Models

    Jul 21, 2026Eric Price, Kevin Tian, Zhiyang Xun +1LLM EvaluationLLM Inference

  20. XL-DocBench: Benchmarking Evidence-Grounded Extra-Long Document Understanding

    Jul 21, 2026Hongchen Wei, Yuanzhe Wang, Bei Liu +9Long-Context RetrievalLLM Evaluation

  21. Find Before You Fine-Tune: A Diagnostic Study of Small LLMs for Cybersecurity QA

    Jul 21, 2026Shaswata Mitra, Subash Neupane, Trisha Chakraborty +4LLM EvaluationLLM Fine-Tuning

  22. It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief

    Jul 20, 2026Kevin Du, Clara Kümpel, Michelle Wastl +1LLM EvaluationKnowledge Conflicts in Language Models