LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Comparing Large Language Models on Scrum Certification-Style Questions: Accuracy, Stability, and Error Patterns

    Jun 29, 2026Robson Alves Vilar, Emanuel Dantas Filho, Ademar França de Sousa Neto +5Software EngineeringLLM Evaluation

  2. RoPoLL: Robust Panel of LLM Judges

    Jun 29, 2026Anish Acharya, Kris W Pan, Brian VerkhovskyLLM EvaluationLLM-as-a-Judge

  3. BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation

    Jun 29, 2026Ankur Samanta, Akshayaa Magesh, Tal Lancewicki +7LLM EvaluationBayesian Inference

  4. When Calibration Rankings Reverse: Accuracy-Controlled Evaluation for Fair Comparison of LLMs

    Jun 29, 2026Zhichao Yang, Caiqi Zhang, Ruihan Yang +3LLM EvaluationConfidence Estimation in Language Models

  5. Poller: Are LLMs Suitable for Evaluating the Poetry Understanding Task?

    Jun 29, 2026Shanshan Wang, Derek F. Wong, Jingming Yao +1LLM EvaluationLLM-as-a-Judge

  6. Clinical Reasoning Graphs: Structured Evaluation of LLM Diagnostic Reasoning Reveals Competence Without Consistency

    Jun 29, 2026Nisarg A. PatelLLM EvaluationReasoning Consistency in Language Models

  7. SrDetection: A Self-Referential Framework for Data Leakage Detection in Code Large Language Models

    Jun 29, 2026Shuaimin Li, Liyang Fan, Zeyang Li +9LLM EvaluationLLM Auditing

  8. How Far Do On-Prem Open LLMs Get on Text-to-SQL? A Cross-Family Size x Technique Frontier on BIRD

    Jun 29, 2026Vladimir BeskorovainyiLLM Self-CorrectionLLM Evaluation

  9. A Diagnostic Framework and Multi-Evaluator Audit of Evaluator-Driven Preference Dynamics in Self-Adapting LLM Agents

    Jun 29, 2026Liu ZewenLLM EvaluationLLM Agent Evaluation

  10. SFBench: The SciFy Scientific Feasibility Benchmark

    Jun 28, 2026Cash Costello, James Mayfield, Elsbeth Turcan +7LLM EvaluationBenchmark Design

  11. Do We Still Need Fine Tuning? Turkish Sentiment Analysis in the Era of Large Language Model

    Jun 28, 2026Sercan Karakaş, Yusuf ŞimşekSupervised Fine-TuningLLM Evaluation

  12. SAKE: Software Architectural Knowledge Evaluation Benchmark for Large Language Models

    Jun 28, 2026Tiziano Santilli, Francesco Daghero, Mayhar Tourchi MoghaddamSoftware EngineeringLLM Evaluation

  13. Cognitive World Models for Process-Level Social Influence Evaluation

    Jun 28, 2026Minghui Ma, Bin Guo, Han Wang +4LLM EvaluationCognitive Modeling

  14. The Complexity Ceiling Benchmark: A Multi-Domain Evaluation of Sequential Reasoning Under Depth Scaling

    Jun 28, 2026Shubh Chapra, Dhruv Kumar, Murari Mandal +1LLM EvaluationStructured Reasoning

  15. Understanding Evaluation Illusion in Diffusion Large Language Models

    Jun 28, 2026Hengxiang Zhang, Jiaxi Ren, Renchunzi Xie +1Prompt SensitivityLLM Evaluation

  16. Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas

    Jun 27, 2026Ioannis Tzachristas, John PavlopoulosLLM EvaluationMoral Reasoning in Language Models

  17. When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling

    Jun 27, 2026Yong Yi Bay, Kathleen A. YearickLLM EvaluationSelf-Consistency Decoding

  18. Correct codes for the wrong reasons? validating LLMs as measurement instruments for theoretical constructs

    Jun 26, 2026Manuel PitaLLM EvaluationPsychometric Validation

  19. Developmental Trajectories of Situation Modeling and Mentalizing in Transformer Language Models

    Jun 26, 2026Pamela D. Rivière, Cameron Jones, Sean TrottLLM EvaluationTheory of Mind

  20. When are likely answers right? On Sequence Probability and Correctness in LLMs

    Jun 25, 2026Johannes Zenn, Jonas GeipingLLM EvaluationLanguage Model Decoding

  21. RSPC: A Benchmark for Modeling Stress and Psychiatric Conditions in Digitally Mediated Relationships using Psychiatrist Annotations

    Jun 25, 2026Parmitha Vangapandu, Sai Ganesh Mokkapati, Sathwik Narkedimilli +4Social Media AnalysisLLM Evaluation

  22. Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement

    Jun 25, 2026Sangwoo Cho, Kushal Chawla, Pengshan Cai +4LLM EvaluationLLM-as-a-Judge

  23. The Riddle Riddle: Testing Flexible Reasoning in Large Language Models and Humans

    Jun 25, 2026Bella Fascendini, Kathryn McGregor, Max D. Gupta +1LLM EvaluationLLM Reasoning