LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. TW-LegalBench: Measuring Taiwanese Legal Understanding

    Jun 17, 2026Fei-Yueh Chen, Chun Huang Lin, Chan Wei Hsu +4LLM EvaluationLegal Judgment Prediction

  2. DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models

    Jun 17, 2026Patrick Cooper, Alvaro VelasquezLLM EvaluationAbductive Reasoning

  3. Evaluating Open-Source LLMs for Multi-Label ATT&CK Technique Classification on CTI Reports

    Jun 16, 2026Ahmed Ryan, Saad Sakib Noor, Md Erfan +3LLM EvaluationCyber Threat Intelligence

  4. The Measurement Gap in the Automation of EU Law: Benchmarking Doctrinal Legal Reasoning under the EU AI Act

    Jun 16, 2026Michèle FinckLLM EvaluationLegal Reasoning

  5. How Inference Compute Shapes Frontier LLM Evaluation

    Jun 16, 2026Jessica McFadyen, Ole Jorgensen, Harry Coppock +2LLM EvaluationLanguage Model Generation Evaluation

  6. DiagFlowBench: Evaluating How Language Models Handle Off-Procedure Inputs in Grounded Diagnostic Dialogue

    Jun 16, 2026Guillermo Gil de Avalle, Laura Maruster, Shaina Raza +1LLM EvaluationLLM Grounding

  7. Prompt Perturbation for Reliable LLM Evaluation over Comparison Graphs

    Jun 16, 2026Dong Huang, Jianbo Sun, Pengkun YangLLM EvaluationPairwise Comparison

  8. The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

    Jun 16, 2026Rui Wen, Lu Sun, Jiayang Liu +3Open-Ended GenerationLLM Evaluation

  9. Understanding LLMs in Title-Abstract Screening: From Disagreements to Recommendations

    Jun 16, 2026Mika Mäntylä, Patricia Matsubara, Katia Romero Felizardo +5LLM EvaluationEvidence Selection

  10. Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings

    Jun 16, 2026Ryo Fukuda, Takatomo Kano, Siddhant Arora +7LLM EvaluationMultimodal Large Language Models

  11. The Consistency Dilemma in LLMs: Generator-Evaluator Agreement and Vulnerability to Mistakes

    Jun 16, 2026Marina Mancoridis, Zoë HitzigLLM EvaluationReasoning Consistency in Language Models

  12. CheckMIABench: Firm Foundations For Membership Inference Attacks on Language Models

    Jun 16, 2026Jeffrey G. Wang, Jason Wang, Marvin Li +1LLM EvaluationMembership Inference Attacks

  13. Do Large Language Models Always Tell The Same Stories?

    Jun 15, 2026Thennal DK, Hans Ole HatzelLLM EvaluationDiverse Text Generation

  14. Thinking Like a Scientist? A Structural Study of LLM-Generated Research Methods

    Jun 15, 2026Francesca Carlon, Brecht Verbeken, Vincent Ginis +1LLM EvaluationAI-Assisted Scientific Research

  15. Evaluating LLM Personalization via Semantic Constraint Verification

    Jun 15, 2026Xuran Li, Guanqin Zhang, Imran Razzak +4LLM EvaluationLLM Personalization

  16. Beyond Helpfulness: A Teaching-over-Solving Diagnostic for Measuring Educational Impact in LLM Tutors

    Jun 15, 2026Junyi Yao, Zihao Zheng, Baichuan LiLLM EvaluationIntelligent Tutoring Systems

  17. GRACE: Step-Level Benchmark for Faithful Reasoning over Context

    Jun 15, 2026Hoang Pham, Dong Le, Anh Tuan LuuCoT FaithfulnessContextual Faithfulness

  18. Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs

    Jun 14, 2026Nafiseh Nikeghbal, Amir Hossein Kargaran, Shaghayegh Kolli +1LLM EvaluationLLM Reliability

  19. SciText2Eq: Assessing LLMs for Explainable Equation Generation for Scientific Creativity

    Jun 14, 2026Yifan Mo, Xiao Fu, Yue Su +4AI for ScienceLLM Evaluation

  20. A Large-Scale Multi-Dimensional Empirical Study of LLMs for Conversation Summarization

    Jun 14, 2026Weixiao Zhou, Gengyao Li, Xianfu Cheng +3LLM EvaluationLong-Context Language Model Evaluation

  21. FinBalance: A Multi-Document Accounting Reconciliation Benchmark

    Jun 14, 2026Sasank Tumpati, Devansh Agarwal, Ayush Kedia +6Financial ServicesLLM Evaluation

  22. David vs. Goliath in Next Activity Prediction: Argmax vs. LSTM, Transformer, and LLM

    Jun 14, 2026Hans Weytjens, Ingo WeberLLM EvaluationPredictive Process Monitoring

  23. LLM Judges Have Dark Current: A Psychometric Datasheet for LLM-as-a-Judge Evaluation

    Jun 14, 2026Hiroyasu Usami, Keisuke Hara, Ayato Tsuboi +1LLM EvaluationLLM-as-a-Judge

  24. Is Code Better Than Language for Algorithmic Reasoning

    Jun 14, 2026Terry Tong, Yu Feng, Surbhi Goel +1LLM EvaluationLLM Tool Use

  25. EIBench: A Simulator-Based Benchmark and Turn-Credit RL for Emotion Management

    Jun 14, 2026Rongzhi Zhu, Xiang Huang, Yuchuan Wu +8RL for Language ModelsLLM Evaluation