LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?

    Apr 19, 2026Miaosen Chai, Wang Bill Zhu, Shangshang Wang +5LLM EvaluationAutomated Program Repair

  2. Beyond "I Don't Know": Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty

    Apr 19, 2026Jingyi Ren, Ante Wang, Yunghwei Lai +5LLM EvaluationSelective Prediction

  3. SciImpact: A Multi-Dimensional, Multi-Field Benchmark for Scientific Impact Prediction

    Apr 18, 2026Hangxiao Zhu, Yuyu Zhang, Ping Nie +1LLM Evaluation

  4. Do LLMs Hold Their Values? MANTA: A Multi-Turn Adversarial Benchmark for Animal Welfare Reasoning

    Apr 18, 2026Isabella Luong, Joyee Chen, Arturs Kanepajs +5LLM EvaluationMoral Reasoning in Language Models

  5. Configuration Over Selection: Hyperparameter Sensitivity Exceeds Model Differences in Open-Source LLMs for RTL Generation

    Apr 18, 2026Minghao Shao, Zeng Wang, Weimin Fu +5LLM EvaluationLanguage Model Generation Evaluation

  6. Auditing Support Strategies in LLMs through Grounded Multi-Turn Social Simulation

    Apr 18, 2026Michelle Star, Andrew Aquilina, Yu-Ru LinLLM EvaluationEmotional Support Conversation

  7. Learning to Trade Like an Expert: Cognitive Fine-Tuning for Stable Financial Reasoning in Language Models

    Apr 18, 2026Yuchen Pan, Soung Chang LiewLLM EvaluationLLM Fine-Tuning

  8. Expressing Social Emotions: Misalignment Between LLMs and Human Cultural Emotion Norms

    Apr 18, 2026Sree Bhattacharyya, Manas Mehta, Leona Chen +4LLM EvaluationCultural Bias in Language Models

  9. Machine individuality: Separating genuine idiosyncrasy from response bias in large language models

    Apr 18, 2026Valentin Kriegmair, Dirk U. WulffLLM EvaluationPersonality Modeling in Language Models

  10. Revisiting a Pain in the Neck: A Semantic Reasoning Benchmark for Language Models

    Apr 17, 2026Yang Liu, Hongming Li, Melissa Xiaohui Qin +2LLM Evaluation

  11. Evaluating the Progression of Large Language Model Capabilities for Small-Molecule Drug Design

    Apr 17, 2026Shriram Chennakesavalu, Kirill Shmilovich, Hayley Weir +5LLM EvaluationMolecular Property Prediction

  12. No Universal Courtesy: A Cross-Linguistic, Multi-Model Study of Politeness Effects on LLMs Using the PLUM Corpus

    Apr 17, 2026Hitesh Mehta, Arjit Saxena, Garima Chhikara +1Multilingual Language Model EvaluationLLM Evaluation

  13. From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text

    Apr 17, 2026Van-Truong LeLLM EvaluationLegal Document Analysis

  14. SwanNLP at SemEval-2026 Task 5: An LLM-based Framework for Plausibility Scoring in Narrative Word Sense Disambiguation

    Apr 17, 2026Deshan Sumanathilaka, Nicholas Micallef, Julian Hough +1LLM EvaluationFew-Shot Prompting

  15. Characterising LLM-Generated Competency Questions: a Cross-Domain Empirical Study using Open and Closed Models

    Apr 17, 2026Reham Alharbi, Valentina Tamma, Terry R. Payne +1LLM Evaluation

  16. BAGEL: Benchmarking Animal Knowledge Expertise in Language Models

    Apr 17, 2026Jiacheng Shen, Masato Hagiwara, Milad Alizadeh +9LLM EvaluationQuestion Answering

  17. On the Robustness of LLM-Based Dense Retrievers: A Systematic Analysis of Generalizability and Stability

    Apr 17, 2026Yongkang Li, Panagiotis Eustratiadis, Yixing Fan +1LLM EvaluationRetrieval Robustness

  18. MEDLEY-BENCH: Scale Buys Evaluation but Not Control in AI Metacognition

    Apr 17, 2026Farhad Abtahi, Abdolamir Karbalaie, Eduardo Illueca-Fernandez +1Belief RevisionLLM Evaluation

  19. How Hypocritical Is Your LLM judge? Listener-Speaker Asymmetries in the Pragmatic Competence of Large Language Models

    Apr 17, 2026Judith Sieker, Sina ZarrießLLM EvaluationLLM-as-a-Judge

  20. QuantSightBench: Evaluating LLM Quantitative Forecasting with Prediction Intervals

    Apr 17, 2026Jeremy Qin, Maksym AndriushchenkoLLM EvaluationForecasting Benchmarks

  21. Artificial Effort

    Apr 17, 2026Federico Belotti, Stefano Coniglio, Antonio Cosma +1LLM Evaluation

  22. Exploring the Capability Boundaries of LLMs in Mastering of Chinese Chouxiang Language

    Apr 17, 2026Dianqing Lin, Tian Lan, Jiali Zhu +7LLM Evaluation

  23. PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research

    Apr 16, 2026Tingjia Miao, Wenkai Jin, Muhua Zhang +19LLM EvaluationAI Agent Benchmarks