LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate

    Aug 8, 2026Anthony Miyaguchi, Conor JohnstonLLM EvaluationLLM-as-a-Judge

  2. CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models

    Aug 8, 2026Siddarth Singh, Victoria Williams, Simon Rosen +6LLM EvaluationMoral Reasoning in Language Models

  3. Evaluator Ensembles Under Reward Hacking: Covariance Geometry and Finite-Search Guarantees

    Aug 8, 2026Fariya Afrin, Ibne Farabi ShihabReward HackingLLM Evaluation

  4. Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions

    Aug 8, 2026Chenrui Fan, Yize Cheng, Ming Li +3LLM EvaluationInference-Time Compute Allocation

  5. Counterfactual Benchmarking and Training for Factuality Consistency and Order-Robust Grounded Reasoning in LLMs over Heterogeneous Knowledge

    Aug 8, 2026Shibo Chu, Yuze Liu, Tiehua Zhang +4LLM EvaluationLLM Grounding

  6. Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation

    Aug 7, 2026Sahil Pardasani, Madhusudan SinghLLM EvaluationLLM-as-a-Judge

  7. GeoBenchLLM: A Comprehensive Benchmark for Evaluating LLMs on Geo-Related Tasks

    Aug 7, 2026Rodrigo Ferreira Rodrigues, Karim Radouane, Jose G Moreno +1Spatial Reasoning BenchmarksLLM Evaluation

  8. Artificial Intelligence Can Match Domain Experts in Evidence Extraction and Critical Appraisal of Microbial Oncogenesis Research Publications

    Aug 7, 2026Kaela Kokkas, Hairong Wang, Richard Klein +11LLM EvaluationOncology

  9. Recipes for Creativity: Iterative Generation and Evaluation in Large Language Models

    Aug 7, 2026Rens Anderson, Tessa Verhoef, Amirhossein ZohrehvandCreativity AssessmentLLM Evaluation

  10. Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical Systems

    Aug 7, 2026Zhongchao Zhou, Yixuan Xie, Wenwei Yu +5LLM EvaluationLanguage Model-Based Control

  11. Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

    Aug 7, 2026Hongyu Luo, He Wang, Huihao Jing +6Creativity AssessmentLLM Evaluation

  12. Critical Acclaim Orientation in Large Language Models: Evidence from Film Preference Elicitation

    Aug 7, 2026Jonghyun Jee, Aaron ShawLLM EvaluationCultural Bias in Language Models

  13. LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers

    Aug 7, 2026Tao Feng, Fangxu Yu, Haozhen Zhang +9LLM EvaluationLLM Routing

  14. TeXFix-Bench: An Empirically Grounded Multi-Format Benchmark for LLM-Based Document Source Repair

    Aug 7, 2026Prajwal S. VenkateshmurthyLLM Evaluation

  15. TradeVerse: A Longitudinal Benchmark of Political Negotiation in International Trade

    Aug 6, 2026Debodeep Banerjee, Amitangshu DasguptaLLM EvaluationAutomated Negotiation

  16. Don't `Well, Actually' Me Unless You Know What You're Talking About: Weak Presupposition Verification Degrades General QA Performance

    Aug 6, 2026Shenran Wang, Vered Shwartz, Hila GonenLLM EvaluationLLM Answer Verification

  17. The Bitter Lesson of Tool Calling

    Aug 6, 2026Ishan Patel, Sahil Sen, Elias Lumer +1LLM EvaluationTool-Augmented Language Model Agents

  18. Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents

    Aug 6, 2026Tao Wang, Qihao Yang, Rongjiao Liang +4LLM Evaluation

  19. What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

    Aug 6, 2026Ro Encarnación, Tina Behzad, Emma Lurie +1LLM Safety BenchmarksLLM Evaluation

  20. LangChoiceBench: Measuring and Explaining Programming-Language Choice in LLMs

    Aug 6, 2026Lukas Twist, Twm Stone, Helen Yannakoudakis +1LLM EvaluationLanguage Model Bias Evaluation

  21. EpiBench: Can LLMs Understand Epitopes for Antibody Drug Discovery?

    Aug 6, 2026Zirui Wang, Jiaqi Wang, Qinghan Wang +4LLM EvaluationDrug Discovery

  22. Mitigating Scoring Bias in LLM-as-a-Judge via Random Number Generation

    Aug 6, 2026Yuma Asato, Kiyoaki Shirai, Natthawut KertkeidkachornLLM EvaluationLLM-as-a-Judge

  23. Human-Like Anaphor Resolution in Large Language Models

    Aug 6, 2026Keane Zhang, Varshini Chinta, Raj Sanjay Shah +1Coreference ResolutionLLM Evaluation

  24. Where Models Converge and Humans Diverge: A Coverage Framework for Distributional Pluralism in Open-Ended Generation

    Aug 6, 2026Zini Yang, Emily Wenger, Richard SoOpen-Ended GenerationLLM Evaluation

  25. Can Open-Weight LLMs Produce Kernel-Verified Coq Proofs? A Pilot Study

    Aug 5, 2026Ahmed Ryan, Md Erfan, Akond Ashfaque Ur Rahman +1LLM EvaluationAutomated Theorem Proving

  26. Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index

    Aug 5, 2026Benjamin Barlog, Hudson Craig, Zedong PengLLM EvaluationLLM Alignment

  27. Sharding Prevents LLM Oversight Failures and Adversarial Exploitation

    Aug 5, 2026Victor Akinwande, J. Zico Kolter, Aran NayebiScalable OversightLLM Evaluation