LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets

    Aug 2, 2026Wenhui Chen, Jianlin Chen, Ziyao Lin +2LLM EvaluationLLM-as-a-Judge

  2. When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty

    Aug 1, 2026Nicolas Leins, Nico Pelleriti, Jana Gonnermann-Müller +1LLM EvaluationLLM Self-Refinement

  3. Multi-Dimensional Assessment for AI Cognition (MAAC): A Theoretical Framework for Process-Oriented Cognitive Evaluation of Text-Based AI Systems

    Aug 1, 2026Abdalla Doleh, Ratna Babu ChinnamLLM Evaluation

  4. TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs

    Aug 1, 2026Dahai Yu, Lin Jiang, Rongchao Xu +1LLM EvaluationReasoning Consistency in Language Models

  5. CurveShift: Is Agent Progress Scalar? Separating Level from Shape

    Jul 31, 2026Hanwen Xing, Pengyun Wang, BingXu Meng +8LLM EvaluationAgent Evaluation

  6. ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models

    Jul 31, 2026Penglin Zhu, Jungang XuLLM EvaluationPairwise Comparison

  7. Language Models Agree With Each Other, Not With Readers

    Jul 31, 2026Kazuki Nakayashiki, Keisuke WatanabeLLM EvaluationHuman-AI Agreement

  8. CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation

    Jul 31, 2026Mengting Chen, Yanshu Sun, Wanting Liang +5Open-Ended GenerationLLM Evaluation

  9. Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding

    Jul 31, 2026Eileen Ye, Jiawen Tao, Yaoming Li +7Conversational MemoryLLM Evaluation

  10. Semantics of Subterfuge: Benchmarking Legal Deception Detection Against General-domain State-of-the-Art

    Jul 31, 2026Theekshana Samaradiwakara, Nisansa de Silva, George C. LobbLegal NLPLLM Evaluation

  11. Benchmarking Frontier Large Language Models Against Official Crash Database Coding Using Police Crash Narratives

    Jul 31, 2026Sudhir Bharati, Rajendra K C Khatri, Sudip BharatiLLM Evaluation

  12. Benchmarks Are Not Validation: A System-Level View of Financial LLM Applications

    Jul 30, 2026Burak Payzun, İrem Demirtaş, Simona Scala +2Financial ServicesLLM Evaluation

  13. Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation

    Jul 30, 2026Philipp D. Siedler, Jordan SassoonLLM EvaluationBenchmark Auditing

  14. When Derived Measurements Mislead: Quantifying and Mitigating LLM Over-Trust with Privileged-Modality Reliability Evidence

    Jul 30, 2026Zongheng Guo, Tao Chen, Tianli Li +6LLM EvaluationLLM Reliability

  15. When Specifications Conflict: A Symmetry-Based Framework for Measuring LLM Preferences

    Jul 30, 2026Tairan Wang, Liang Zhou, Zikang Zhan +1LLM EvaluationKnowledge Conflicts in Language Models

  16. MORFES: A Benchmark for Productive Inflectional Competence in Modern Greek

    Jul 30, 2026Ioakeim Perros, Cleopatra Papadopoulou, Ayoub Kirouane +1Multilingual Language Model EvaluationLLM Evaluation

  17. Rethinking LLM-Judged Helpfulness as a Pedagogy Signal: A Pre-Registered Audit Across Tutor Models

    Jul 30, 2026Shuyi Fan, Boyuan Deng, Mengyu Xu +4LLM EvaluationLLM-as-a-Judge

  18. Challenges in annotations by humans and LLMs: A case study of evaluative language

    Jul 30, 2026Mirela Imamovic, Aenne Cecilia Kristine Knierim, Khushi Pitroda +1LLM EvaluationLLM-Assisted Annotation

  19. An Instrument to Evaluate Governance Proposals: AI Policy Analysis at Scale

    Jul 30, 2026Paulo Carvao, Claudio Mayrink Verdun, Isabel Adler +1LLM EvaluationPolicy Evaluation

  20. RepBench: Compiling Benchmarks into Capability Representations for Large Language Models

    Jul 30, 2026Yanshi Li, Xueru Bai, Shuman Liu +1LLM EvaluationLLM Interpretability

  21. AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision Verification

    Jul 30, 2026Haobo Li, Eunseo Jung, Wenxiao Zhao +8LLM EvaluationScholarly Peer Review

  22. Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation

    Jul 30, 2026Yuhang Zhu, Mingxuan Du, Benfeng Xu +3LLM EvaluationLarge Language Model-Based Role-Play Simulation

  23. From Single- to Cross-Document: Benchmarking Multi-Granularity Event Analysis of Large Language Models

    Jul 30, 2026Tao Wen, Shuai Shao, Pei Ke +7LLM EvaluationLLM Information Extraction