LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. Stress-Testing Efficient Responsible-AI Evaluation: When Compute Savings Change Benchmark Conclusions

    Aug 31, 2026Ahmed El Kady, Aravind Narayanan, Rehana Noorani +2LLM EvaluationEnergy-Efficient ML

  2. Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores

    Aug 31, 2026Qiyao Yan, Chenpeng Wang, Liangming PanLLM EvaluationLanguage Model Calibration

  3. Evaluating and Improving LLM Self-Modeling

    Aug 31, 2026Siqi Zeng, Andre N. Assis, Rowan WangLLM EvaluationLanguage Model Introspection

  4. CLIN: an Objective Framework for Evaluating Creativity in Short Persian Literary Text

    Aug 31, 2026Mohammad Reza Modarres, Armin Tourajmehr, Yadollah Yaghoobzadeh +1Creativity AssessmentLLM Evaluation

  5. Automated Testing of LLM-Based Post Hoc Explainers Using Model Checking as an Oracle

    Aug 31, 2026Dennis Gross, Helge SpiekerLLM EvaluationFaithfulness of Language Model Explanations

  6. Retrieval, Scoring, and Decoding Shape Performance and Stability in LLM-based Conversational Recommendation

    Aug 31, 2026Ante Kapetanovic, Tomislav Duricic, Andro Mercep +1LLM EvaluationLLM Reranking

  7. ScienceArena: Benchmarking LLMs on Latest Scientific Olympiad Competitions

    Aug 31, 2026Guangxiang Zhao, Qilong Shi, Xusen Xiao +13LLM EvaluationScientific Reasoning

  8. DERELAB: Probing Defeasible Reasoning and Confirmation Bias in LLMs with a Generative Benchmark

    Aug 31, 2026Jayanta Sadhu, Sayem Shahad, Kenneth MarinoLLM EvaluationBelief Updating in LLMs

  9. Co-Evolving Actor-Conditioned Critics for Non-Verifiable Generation

    Aug 31, 2026Jinyoung Kim, Muhammad Khalifa, Lajanugen Logeswaran +4RL for Language ModelsLLM Evaluation

  10. Beyond Ranking Accuracy: Evaluating LLM-Cited Feature Rationales for Next Basket Repurchase Recommendation

    Aug 31, 2026Yanan Cao, Anay Dombe, Murali Mohana Krishna Dandu +5Sequential RecommendationLLM Evaluation

  11. Do Small Models Use the Law You Give Them? Measuring Context Use on a Bilingual Bangladesh Legal Benchmark

    Aug 31, 2026Moniruzzaman Mahadi, Abrar Mohammed Tanzim Alam, Sayma Siddika Monalisa +3Multilingual Language Model EvaluationLLM Evaluation

  12. Beyond Surface Forms: Symbolic Edits as a Test for Logical Reasoning with LLMs

    Aug 31, 2026Ramya Keerthy Thatikonda, Wray Buntine, Ehsan ShareghiLogical ReasoningLLM Evaluation

  13. Manacá-1B: An Open, Reproducible Brazilian-Portuguese Language Model and a Tokenizer-Aware, Paired Evaluation

    Aug 31, 2026Bruno Leonardo Santos Menezes, Carlos Leonardo Souza Cardoso, Fabio Andre Machado PortoLanguage Model PretrainingLLM Evaluation

  14. Error Detection for PET/CT Radiology Reports: Domain-Specific vs Large Language Models

    Aug 30, 2026Hermione Warr, Harry Anthony, Lilli J Freischem +3LLM EvaluationPET/CT Imaging

  15. Detecting Hidden Chain-of-Thought in Large Language Models with Linguistic, Behavioral, and Mechanistic Indicators

    Aug 30, 2026Armaan Singh, Ryan Trinh Le, Jasmine Kaur +5LLM EvaluationLLM Interpretability

  16. Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation

    Aug 30, 2026Nishant Balepur, Paiheng Xu, Wei Ai +3LLM EvaluationMultiple-Choice Question Answering

  17. Do LLMs Change Their Minds Like Humans? Diagnosing Human--LLM Divergence in Single-Turn Persuasion Judgments

    Aug 30, 2026Lin Chen, Yitong Chen, Yong LiLLM EvaluationBelief Updating in LLMs

  18. Evaluating the Capabilities of LLMs for Persuasive Dialogue

    Aug 30, 2026Jordan Robinson, Angus R. Williams, Katie Atkinson +1LLM EvaluationMulti-Agent Debate

  19. Apples to Apples? Towards Comparable Crosslingual Language Model Evaluation

    Aug 25, 2026Xiulin Yang, Ethan Gotlieb Wilcox, Catherine ArnettMultilingual Language Model EvaluationLLM Evaluation

  20. Beyond Semantic Accuracy: Consequence-Aware Evaluation for Safety-Critical Language Understanding

    Aug 25, 2026Yujing Chang, Thinh Pham, Van-Phat Thai +4LLM Safety BenchmarksLLM Evaluation

  21. LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

    Aug 24, 2026Xiao Zhang, Qumeng Sun, Jiahao Li +3Agent MemoryLLM Evaluation

  22. ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation

    Aug 23, 2026Kaustubh D. Dhole, Charles L. A. Clarke, Eugene Y. AgichteinLLM EvaluationRubric-Based Evaluation

  23. FlavourBench: Executable Culinary Reward Maps for Language Model Evaluation and Post-Training

    Aug 20, 2026Josef Chen, Erim HayretciLLM EvaluationSupervised Fine-Tuning

  24. Decomposing Wrong-Consensus Agreement in LLM Self-Consistency

    Aug 19, 2026Lizhuo Zhang, Mengmeng Tang, Chenfeng Long +2LLM EvaluationLLM Reliability

  25. The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

    Aug 18, 2026Emma Yanyang Kong, JJ Tan, Ishan Gupta +8LLM EvaluationLLM-as-a-Judge