LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models

    Mar 30, 2026Han Wang, Yifan Sun, Brian Ko +8CoT FaithfulnessLLM Evaluation

  2. Not All Subjectivity Is the Same! Defining Desiderata for the Evaluation of Subjectivity in NLP

    Mar 30, 2026Urja Khurana, Michiel van der Meer, Enrico Liscio +2LLM Evaluation

  3. Learning to Predict Future-Aligned Research Proposals with Language Models

    Mar 28, 2026Heng Wang, Pengcheng Jiang, Jiashuo Sun +4LLM EvaluationResearch Idea Generation

  4. When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models

    Mar 27, 2026Juan Gabriel Kostelec, Qinghai GuoLLM Inference EfficiencyLLM Evaluation

  5. In-Context Molecular Property Prediction with LLMs: A Blinding Study on Memorization and Knowledge Conflicts

    Mar 26, 2026Matthias Busch, Marius Tacke, Sviatlana V. Lamaka +4LLM EvaluationKnowledge Conflicts in Language Models

  6. PROMPT2BOX: Uncovering Entailment Structure among LLM Prompts

    Mar 22, 2026Neeladri Bhuiya, Shib Sankar Dasgupta, Andrew McCallum +1LLM EvaluationRepresentation Learning

  7. Policies Permitting LLM Use for Polishing Peer Reviews Are Currently Not Enforceable

    Mar 20, 2026Rounak Saha, Gurusha Juneja, Dayita Chaudhuri +3LLM EvaluationAI-Generated Text Detection

  8. ZEBRAARENA: A Diagnostic Simulation Environment for Studying Reasoning-Action Coupling in Tool-Augmented LLMs

    Mar 19, 2026Wanjia Zhao, Ludwig Schmidt, Yejin Choi +3LLM EvaluationAI Agent Benchmarks

  9. Toward Measuring Structural Drift in LLM Communication Loops

    Mar 18, 2026Wael Hafez, Amir Nazeri, Chenan WeiLLM Evaluation

  10. Arabic Morphosyntactic Tagging and Dependency Parsing with Large Language Models

    Mar 17, 2026Mohamed Adel, Bashar Alhafni, Nizar HabashLLM EvaluationArabic NLP

  11. SciZoom: A Large-scale Benchmark for Hierarchical Scientific Summarization across the LLM Era

    Mar 17, 2026Han Jang, Junhyeok Lee, Kyu Sung ChoiLLM EvaluationScientific Communication

  12. CzechTopic: A Benchmark for Zero-Shot Topic Localization in Historical Czech Documents

    Mar 4, 2026Martin Kostelník, Michal Hradiš, Martin DočekalDocument UnderstandingHistorical Document Analysis

  13. Verify to Amplify: Improving Reasoning via Learned Chain-of-Thought Verification

    Mar 3, 2026Maria-Florina Balcan, Avrim Blum, Kiriaki Fragkia +2LLM EvaluationLLM Answer Verification

  14. A Neuropsychologically Grounded Evaluation of LLM Cognitive Abilities

    Mar 3, 2026Faiz Ghifari Haznitrama, Faeyza Rishad Ardi, Alice OhLLM Evaluation

  15. HEARTS: Benchmarking LLM Reasoning on Health Time Series

    Feb 25, 2026Sirui Li, Shuhan Xiao, Mihir Joshi +4LLM EvaluationTime Series Reasoning

  16. Disentangling Geometry, Performance, and Training in Language Models

    Feb 24, 2026Atharva Kulkarni, Jacob Mitchell Springer, Arjun Subramonian +1LLM EvaluationNeural Representation Geometry

  17. CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching

    Feb 23, 2026Yuzhe Wang, Yaochen Zhu, Jundong LiLLM EvaluationCausal Reasoning in Language Models

  18. Diagnosing LLM Reranker Behavior Under Fixed Evidence Pools

    Feb 20, 2026Baris Arat, Emre SeferLLM EvaluationLLM Reranking

  19. VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean

    Feb 20, 2026Yutong Xin, Qiaochu Chen, Greg Durrett +1LLM EvaluationFormal Verification

  20. Capabilities Ain't All You Need: Measuring Propensities in AI

    Feb 20, 2026Daniel Romero-Alvarado, Fernando Martínez-Plumed, Lorenzo Pacchiardi +11LLM EvaluationItem Response Theory

  21. When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

    Feb 18, 2026Mubashara Akhtar, Anka Reuel, Prajna Soni +34LLM EvaluationBenchmark Design

  22. SpreadsheetArena: Decomposing Preference in LLM Generation of Spreadsheet Workbooks

    Feb 16, 2026Srivatsa Kundurthy, Clara Na, Michael Handley +5LLM EvaluationLanguage Model Generation Evaluation

  23. On Calibration of Large Language Models: From Response To Capability

    Feb 14, 2026Sin-Han Yang, Cheng-Kuang Wu, Chieh-Yen Lin +3LLM EvaluationConfidence Estimation in Language Models

  24. Investigating Learner-Aware Design of LLM-Generated Educational Feedback

    Feb 12, 2026Momoka Furuhashi, Kouta Nakayama, Noboru Kawai +3LLM EvaluationEducational Technology