LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. Can LLMs Value the Right Evidence? Evidence-Value Misalignment in Dynamic Medical Diagnosis

    Sep 28, 2026Kehua Feng, Yunsheng Lu, Yitong Qiao +5LLM EvaluationEvidence-Grounded Reasoning

  2. AraDynFact: Dynamic Evaluation of Factual Knowledge in Arabic

    Sep 28, 2026Ignacio Iacobacci, Faroq Altam, Zhaozhi Qian +1LLM EvaluationArabic NLP

  3. AwarenessBench: Assessing Cognitive Capabilities of Language Models

    Sep 28, 2026Xiaojian Li, Rongwu Xu, Tianyun Zhang +9LLM EvaluationEvaluation Awareness in Language Models

  4. How Well Can LLMs Simulate Real Learner Evaluations of Educational Feedback?

    Sep 28, 2026Momoka Furuhashi, Kouta Nakayama, Takashi Kodama +2LLM EvaluationLarge Language Model-Based Social Simulation

  5. Large Language Models for Automated Cross-Domain Machine Learning Task Type Identification: A Benchmark Dataset and Evaluation

    Sep 28, 2026Petros Tsialis, Steffen Limmer, Tobias Rodemann +1LLM EvaluationTabular ML

  6. MemoReason: Evaluating the Effect of Parametric Memory on Contextual Reasoning in LLMs

    Sep 28, 2026Zineddine Tighidet, Andrea Mogini, Jiali Mei +2LLM EvaluationMemorization in Language Models

  7. Measuring Collapse and Correction in Homogeneous-Panel LLM Debate

    Sep 28, 2026Xin Li, Mengbing Liu, Chau YuenLLM EvaluationLLM Auditing

  8. VEX-Bench: Benchmarking Verification Complexity of LLM-Generated Misinformation

    Sep 28, 2026Hanxun Huang, Yutao Wu, Qizhou Wang +9LLM EvaluationFake News Detection

  9. Pass or Fail? Evaluating LLMs on Two Greek Examination Benchmarks

    Sep 28, 2026Panagiota Kyriazi, Eleni Kasoura, Prokopis ProkopidisMultilingual Language Model EvaluationPrompt Sensitivity

  10. TQTS-Bench: A Multi-Syntax Benchmark for Text-to-Query over Time-Series Databases

    Sep 28, 2026Fei Lyu, Zhiyi Peng, Jiaming Liu +5LLM EvaluationTime Series QA

  11. Using LLMs to Detect LLM-Generated Texts: A Cross-Generation Analysis

    Sep 28, 2026Haiyue Yuan, Jie Guo, Weidong Qiu +3LLM EvaluationAI-Generated Text Detection

  12. SleuthBench: Benchmarking Statistical LLM Evaluation Using Tabular Hidden Signals

    Sep 28, 2026Jingyun Jia, Antoine Remond-Tiedrez, Aaron Alvarez +3LLM EvaluationAI Agent Benchmarks

  13. Do System One Decisions Add Up? A Study of Probabilistic Coherence

    Sep 27, 2026Saman Sarker JoyLLM EvaluationClassification

  14. The Effects of Incremental Instruction Delivery on Language-Model Creative Writing

    Sep 27, 2026Anshuman Singh, Abrar Eyasir, Haseeb Yaqoob +1LLM EvaluationLLM Prompting

  15. From Granular Revision Operations to Meaningful Revision Units: Evaluating LLMs for Revision Boundary Detection

    Sep 27, 2026Yu Tian, Andrew Potter, Katerina Christhilf +4LLM Evaluation

  16. One Model Is Not a Crowd: Multi-LLM and Aspect-Conditioned Diverse Comment Generation

    Sep 27, 2026Nafis Irtiza Tripto, Delvin Ce Zhang, Mahjabin Nahar +1LLM EvaluationControllable Text Generation

  17. E-CONAN (Entailment, CONtradition And Neutral) Diagnostics Dataset Investigating Linguistic Phenomena in Arabic Natural Language Understanding

    Sep 27, 2026Khloud AL Jallad, Nada Ghneim, Ghaida RebdawiLLM EvaluationArabic NLP

  18. LLM4Trust: Exploring the Capabilities of Large Language Models for Trust Evaluation

    Sep 27, 2026Jie Wang, Yanbo Sun, Zheng Yan +2LLM EvaluationTrust in AI

  19. MetaBench-Harness: Unlocking End-to-End Optimization of Benchmark Harnesses

    Sep 27, 2026Xuanjun Chen, Hua-Hsuan Chen, Wei-Chung Lu +3LLM EvaluationBenchmark Design

  20. Knowing Is Not Choosing: What Explicit Verification Adds Beyond Generative Preference

    Sep 27, 2026Yilong Li, Chengpo Yan, Aayan Arish +1LLM EvaluationLLM Answer Verification

  21. LLM Judge Validation Under Sparse Overlap: From Inference to Design

    Sep 25, 2026Junxuan Li, Arko Mukherjee, Soumyabrata PalInter-Rater ReliabilityLLM Evaluation