LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation

    Aug 30, 2026Nishant Balepur, Paiheng Xu, Wei Ai +3LLM EvaluationMultiple-Choice Question Answering

  2. Do LLMs Change Their Minds Like Humans? Diagnosing Human--LLM Divergence in Single-Turn Persuasion Judgments

    Aug 30, 2026Lin Chen, Yitong Chen, Yong LiLLM EvaluationBelief Updating in LLMs

  3. Evaluating the Capabilities of LLMs for Persuasive Dialogue

    Aug 30, 2026Jordan Robinson, Angus R. Williams, Katie Atkinson +1LLM EvaluationMulti-Agent Debate

  4. Apples to Apples? Towards Comparable Crosslingual Language Model Evaluation

    Aug 25, 2026Xiulin Yang, Ethan Gotlieb Wilcox, Catherine ArnettMultilingual Language Model EvaluationLLM Evaluation

  5. Beyond Semantic Accuracy: Consequence-Aware Evaluation for Safety-Critical Language Understanding

    Aug 25, 2026Yujing Chang, Thinh Pham, Van-Phat Thai +4LLM Safety BenchmarksLLM Evaluation

  6. LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks

    Aug 24, 2026Xiao Zhang, Qumeng Sun, Jiahao Li +3Agent MemoryLLM Evaluation

  7. ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation

    Aug 23, 2026Kaustubh D. Dhole, Charles L. A. Clarke, Eugene Y. AgichteinLLM EvaluationRubric-Based Evaluation

  8. FlavourBench: Executable Culinary Reward Maps for Language Model Evaluation and Post-Training

    Aug 20, 2026Josef Chen, Erim HayretciLLM EvaluationSupervised Fine-Tuning

  9. Decomposing Wrong-Consensus Agreement in LLM Self-Consistency

    Aug 19, 2026Lizhuo Zhang, Mengmeng Tang, Chenfeng Long +2LLM EvaluationLLM Reliability

  10. The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

    Aug 18, 2026Emma Yanyang Kong, JJ Tan, Ishan Gupta +8LLM EvaluationLLM-as-a-Judge

  11. PTXBench: Benchmarking and Adapting LLMs for GPU Kernel Optimization with Architecture-specific PTX

    Aug 18, 2026Genghan Zhang, Yixin Dong, Chengze Fan +4LLM EvaluationGPU Kernel Optimization

  12. Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation

    Aug 13, 2026Junhao Luo, Ning Huang, Ziqi Sha +2LLM EvaluationLLM Auditing

  13. TsuGO: Probing Search Efficiency in LLM Reasoning via Go Life-and-Death Problems

    Aug 13, 2026Shunwen Bai, Ziping Ma, Chaoyang Zhang +4LLM EvaluationInference-Time Search

  14. LigBench: A Unified and Human-Aligned Benchmark for LLM-based Research Idea Generation

    Aug 13, 2026Chenrun Wang, Mingxuan Zhu, Tiancheng Huang +6LLM EvaluationBenchmark Design

  15. The Embedder's Dilemma: LLMs Are Better, but at What Cost?

    Aug 13, 2026Adnan El Assadi, Niklas Muennighoff, Jinhyuk LeeLLM Inference EfficiencyLLM Evaluation

  16. Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence

    Aug 12, 2026Justin Zhao, Himaghna Bhattacharjee, Hannah Korevaar +2LLM EvaluationLLM-as-a-Judge

  17. Novels generated by language models show compressed formal variation

    Aug 12, 2026Mehdy Sedaghat Payam, Justin QuinnLLM EvaluationLong-Form Document Generation

  18. NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation

    Aug 12, 2026Jiarui Ma, Jianghan Wang, Yuheng Ma +2LLM EvaluationBenchmark Design

  19. Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

    Aug 12, 2026Rodrigo Guedes de Souza, Alison R. PanissonLLM EvaluationLanguage Model Generation Evaluation

  20. RealisticTritonBench: A Benchmark for Triton-Kernel Generation in Real-World AI Frameworks

    Aug 12, 2026Jinjun Huang, Zhongzhen Wen, Tongtong Xu +3LLM EvaluationGPU Kernel Generation

  21. Benchmark-Based Comparative Assessment of Publicly Benchmarked Indian Foundation Models: A Capability and Evaluation-Maturity Framework

    Aug 12, 2026Avinash Agarwal, Vridhi JainLLM Evaluation

  22. The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance

    Aug 12, 2026Shailja Thakur, Sungeun An, Chad DeLuca +1Prompt SensitivityLLM Evaluation