LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. Fabricator or dynamic translator?

    Apr 16, 2026Lisa Vasileva, Karin SimLLM EvaluationHallucination Detection

  2. Pushing the Boundaries of Multiple Choice Evaluation to One Hundred Options

    Apr 16, 2026Nahyun Lee, Guijin SonLLM EvaluationMultiple-Choice Question Answering

  3. Prompt-Driven Code Summarization: A Systematic Literature Review

    Apr 16, 2026Afia Farjana, Zaiyu Cheng, Antonio MastropaoloLLM EvaluationLLM Prompting

  4. PeerPrism: Peer Evaluation Expertise vs Review-writing AI

    Apr 16, 2026Soroush Sadeghian, Alireza Daqiq, Radin Cheraghi +3LLM EvaluationAI-Generated Text Detection

  5. A Robust Evaluation of Probe Robustness: Lessons for Reliable OOD Uncertainty Quantification

    Apr 13, 2026Joe Stacey, Hadas Orgad, Kentaro Inui +2LLM EvaluationUncertainty Quantification

  6. Handle with CARE: Can LLMs Reproduce How Online Communities React?

    Apr 12, 2026Nuan Wen, Chanbin Lim, Xuezhe MaLarge Language Model-Based Social SimulationLLM Evaluation

  7. What Does a Sharing Question Add? Auditing LLM Survey Scores for Misinformation

    Apr 8, 2026Zonghuan Xu, Xiang Zheng, Yutao Wu +1LLM EvaluationLLM Auditing

  8. LLM Evaluation as Tensor Completion: Low Rank Structure and Semiparametric Efficiency

    Apr 7, 2026Jiachun Li, David Simchi-Levi, Will Wei SunSemiparametric InferenceLLM Evaluation

  9. LiveMathematicianBench: A Live Benchmark for Research-Level Mathematical Reasoning with Proof Sketches

    Apr 2, 2026Linyang He, Qiyao Yu, Hanze Dong +5Mathematical Reasoning BenchmarksLLM Evaluation

  10. Are Finer Citations Always Better? Rethinking Granularity for Attributed Generation

    Apr 1, 2026Hexuan Wang, Jingyu Zhang, Benjamin Van Durme +1LLM EvaluationLLM Grounding

  11. Measuring (some aspects of) the metacognition of AI

    Mar 31, 2026Richard Servajean, Philippe ServajeanLLM EvaluationLLM Uncertainty Estimation

  12. MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models

    Mar 30, 2026Han Wang, Yifan Sun, Brian Ko +8CoT FaithfulnessLLM Evaluation

  13. Not All Subjectivity Is the Same! Defining Desiderata for the Evaluation of Subjectivity in NLP

    Mar 30, 2026Urja Khurana, Michiel van der Meer, Enrico Liscio +2LLM Evaluation

  14. Learning to Predict Future-Aligned Research Proposals with Language Models

    Mar 28, 2026Heng Wang, Pengcheng Jiang, Jiashuo Sun +4LLM EvaluationResearch Idea Generation

  15. When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models

    Mar 27, 2026Juan Gabriel Kostelec, Qinghai GuoLLM Inference EfficiencyLLM Evaluation

  16. In-Context Molecular Property Prediction with LLMs: A Blinding Study on Memorization and Knowledge Conflicts

    Mar 26, 2026Matthias Busch, Marius Tacke, Sviatlana V. Lamaka +4LLM EvaluationKnowledge Conflicts in Language Models

  17. PROMPT2BOX: Uncovering Entailment Structure among LLM Prompts

    Mar 22, 2026Neeladri Bhuiya, Shib Sankar Dasgupta, Andrew McCallum +1LLM EvaluationRepresentation Learning

  18. Policies Permitting LLM Use for Polishing Peer Reviews Are Currently Not Enforceable

    Mar 20, 2026Rounak Saha, Gurusha Juneja, Dayita Chaudhuri +3LLM EvaluationAI-Generated Text Detection

  19. ZEBRAARENA: A Diagnostic Simulation Environment for Studying Reasoning-Action Coupling in Tool-Augmented LLMs

    Mar 19, 2026Wanjia Zhao, Ludwig Schmidt, Yejin Choi +3LLM EvaluationAI Agent Benchmarks

  20. Toward Measuring Structural Drift in LLM Communication Loops

    Mar 18, 2026Wael Hafez, Amir Nazeri, Chenan WeiLLM Evaluation

  21. Arabic Morphosyntactic Tagging and Dependency Parsing with Large Language Models

    Mar 17, 2026Mohamed Adel, Bashar Alhafni, Nizar HabashLLM EvaluationArabic NLP

  22. SciZoom: A Large-scale Benchmark for Hierarchical Scientific Summarization across the LLM Era

    Mar 17, 2026Han Jang, Junhyeok Lee, Kyu Sung ChoiLLM EvaluationScientific Communication

  23. CzechTopic: A Benchmark for Zero-Shot Topic Localization in Historical Czech Documents

    Mar 4, 2026Martin Kostelník, Michal Hradiš, Martin DočekalDocument UnderstandingHistorical Document Analysis

  24. Verify to Amplify: Improving Reasoning via Learned Chain-of-Thought Verification

    Mar 3, 2026Maria-Florina Balcan, Avrim Blum, Kiriaki Fragkia +2LLM EvaluationLLM Answer Verification

  25. A Neuropsychologically Grounded Evaluation of LLM Cognitive Abilities

    Mar 3, 2026Faiz Ghifari Haznitrama, Faeyza Rishad Ardi, Alice OhLLM Evaluation