LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. CARE: Confounder-Aware Aggregation for Reliable LLM Evaluation

    Feb 9, 2026Jitian Zhao, Changho Shin, Tzu-Heng Huang +2LLM EvaluationLLM-as-a-Judge

  2. BRIDGE: Predicting Human Task Completion Time From Model Performance

    Feb 6, 2026Fengyuan Liu, Jay Gala, Nilaksh +3LLM EvaluationLanguage Model Scaling Laws

  3. FairJudge: An Adaptive, Debiased, and Consistent LLM-as-a-Judge

    Feb 6, 2026Bo Yang, Lanfei Feng, Yunkui Chen +3LLM EvaluationLLM-as-a-Judge

  4. Aligning Language Model Benchmarks with Pairwise Preferences

    Feb 2, 2026Marco Gutierrez, Xinyi Leng, Hannah Cyberey +3LLM EvaluationLearning to Rank

  5. Learning More from Less: Unlocking Internal Representations for Benchmark Compression

    Jan 31, 2026Yueqi Zhang, Jin Hu, Shaoxiong Feng +9LLM EvaluationRepresentation Learning

  6. Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry

    Jan 30, 2026Zhuochun Li, Yong Zhang, Ming Li +8LLM EvaluationLLM-as-a-Judge

  7. Assessing the Business Process Modeling Competences of Large Language Models

    Jan 29, 2026Chantale Lauer, Peter Pfeiffer, Alexander Rombach +1LLM Evaluation

  8. More Bang for the Buck: Improving the Inference of Large Language Models at a Fixed Budget using Reset and Discard (ReD)

    Jan 29, 2026Sagi Meir, Tommer D. Keidar, Noam Levi +2LLM Inference EfficiencyLLM Evaluation

  9. LLMs versus the Halting Problem: Characterizing Program Termination Reasoning

    Jan 26, 2026Oren Sultan, Jordi Armengol-Estape, Pascal Kesseli +4LLM EvaluationStatic Code Analysis

  10. Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models

    Jan 21, 2026Shahar Ben-Natan, Oren TsurLLM EvaluationLLM Sycophancy

  11. MAPLE: Metadata Conditioned LLM Pretraining for Locale-Aware Question Answering

    Jan 21, 2026Anjishnu Mukherjee, Ziwei Zhu, Antonios AnastasopoulosLanguage Model PretrainingLLM Evaluation

  12. Confident Rankings with Fewer Items: Adaptive LLM Evaluation with Continuous Scores

    Jan 20, 2026Esma Balkır, Alice Pernthaller, Marco Basaldella +2LLM EvaluationItem Response Theory

  13. No Reliable Evidence of Self-Reported Sentience in Small Large Language Models

    Jan 20, 2026Caspar Kaiser, Sean EnderbyLLM EvaluationLanguage Model Self-Assessment

  14. OI-Bench: An Option Injection Benchmark for Evaluating LLM Susceptibility to Directive Interference

    Jan 19, 2026Yow-Fu Liou, Yu-Chien Tang, Yu-Hsiang Liu +1LLM EvaluationAdversarial Robustness of Language Models

  15. STAGE: A Full-Screenplay Benchmark for Reasoning over Evolving Stories

    Jan 13, 2026Qiuyu Tian, Zequn Liu, Yiding Li +9KG ConstructionLLM Evaluation

  16. Calibration Is Not Enough: Evaluating Confidence Estimation Under Language Variations

    Jan 12, 2026Yuxi Xia, Dennis Ulmer, Terra Blevins +3LLM EvaluationConfidence Estimation in Language Models

  17. Kinship Data Benchmark for Multi-hop Reasoning

    Jan 12, 2026Tianda Sun, Dimitar KazakovLLM EvaluationSynthetic Benchmark Generation

  18. Measuring Iterative Temporal Reasoning with Time Puzzles

    Jan 12, 2026Zhengxiang Wang, Zeyu DongLLM EvaluationTemporal Reasoning in Language Models

  19. BizFinBench.v2: Towards Reliable LLMs in Finance via Real-User Data and Offline/Online Bilingual Evaluation

    Jan 10, 2026Xin Guo, Rongjunchen Zhang, Guilong Lu +4Financial ServicesMultilingual Language Model Evaluation

  20. Thunder-KoNUBench: A Corpus-Aligned Benchmark for Korean Negation Understanding

    Jan 8, 2026Sungmok Jung, Yeonkyoung So, Joonhak Lee +3LLM EvaluationLLM Fine-Tuning

  21. Gavel: Agent Meets Checklist for Evaluating LLMs on Long-Context Legal Summarization

    Jan 7, 2026Yao Dou, Benjamin Mamut, Wei XuLegal NLPLLM Evaluation

  22. Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict

    Jan 7, 2026Guanyu Chen, Chenxiao Yu, Xiyang HuLLM EvaluationLLM Alignment

  23. EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering and Reasoning

    Jan 6, 2026Mingyang Wei, Dehai Min, Zewen Liu +8LLM EvaluationHealthcare

  24. Who Laughs with Whom? Disentangling Influential Factors in Humor Preferences across User Clusters and LLMs

    Jan 6, 2026Soichiro Murakami, Hidetaka Kamigaito, Hiroya Takamura +1LLM EvaluationHuman Preference Modeling

  25. Psychometric Comparability of LLM-Based Digital Twins

    Dec 22, 2025Yufei Zhang, Zhihao MaLLM EvaluationPersonality Modeling in Language Models

  26. Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length

    Dec 7, 2025Zhiyu Xu, Jia Liu, Yixin Wang +1LLM EvaluationLatent Variable Models

  27. RippleBench: Capturing Ripple Effects Using Existing Knowledge Repositories

    Dec 3, 2025Roy Rinberg, Usha Bhalla, Igor Shilov +2LLM EvaluationLLM Unlearning