LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. SICI: A Semantic-Pragmatic Complexity Index Reveals Regime Shifts in LLM Stance Detection

    Jun 11, 2026Fuqiang Niu, Bowen ZhangLLM EvaluationStance Detection

  2. MÖVE: A Holistic LLM Benchmark for the German Public Sector

    Jun 11, 2026Camilla Dalerci, Thilo Michael, Robin Schaefer +1Multilingual Language Model EvaluationLLM Evaluation

  3. The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI Systems

    Jun 11, 2026Jiaqi Luo, Jiarun Dai, Zhile Chen +8LLM EvaluationAI Agent Security Benchmarks

  4. SciR: A Controllable Benchmark for Scientific Reasoning in LLMs

    Jun 11, 2026Pierre Beckmann, Marco Valentino, Andre FreitasLLM EvaluationScientific Reasoning

  5. GENIE: A Fine-Grained Measure for Novelty

    Jun 11, 2026Ramya Namuduri, Manya Wadhwa, Anshun Asher Zheng +2LLM EvaluationLanguage Model Generation Evaluation

  6. Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

    Jun 10, 2026Zahra Habibzadeh, Paria Khoshtab, Amir Mesbah +1LLM EvaluationLLM Grounding

  7. Measuring Semantic Progress in Multi-turn Dialogue via Information Gain

    Jun 10, 2026Paul He, Shiva Kasiviswanathan, Dominik JanzingLLM EvaluationMulti-Turn Dialogue Evaluation

  8. Reassessing High-Performing LLMs on Polish Medical Exams: True Competence or Bias-Driven Performance?

    Jun 10, 2026Antoni Lasik, Jakub Pokrywka, Łukasz Grzybowski +7LLM EvaluationLLM Reliability

  9. Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation

    Jun 10, 2026Selen Erkan, Bastian Boll, Kristian Kersting +2LLM EvaluationInstruction Following

  10. Automated Creativity Evaluation of Language Models Across Open-Ended Tasks

    Jun 10, 2026Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff +4Creativity AssessmentLLM Evaluation

  11. Can AI Reason Like an Urban Planner? Benchmarking Large Language Models Against Professional Judgment

    Jun 10, 2026Yijie Deng, He Zhu, Wen Wang +3LLM EvaluationUrban Planning

  12. Are LLMs Bad at Moral Reasoning?

    Jun 10, 2026Menghang Zhu, Seth LazarLLM EvaluationMoral Reasoning in Language Models

  13. GraphInfer-Bench: Benchmarking LLM's Inference Capability on Graphs

    Jun 10, 2026Zhuoyi Peng, Jingzhou Jiang, Hanlin Gu +2LLM EvaluationGraph Neural Networks

  14. MPC-Patch-Bench: Security-Aware LLM Code Patch for Multi-Party Computation

    Jun 9, 2026Yukuan Zhang, Mengxin Zheng, Qian LouSecure Multi-Party ComputationLLM Evaluation

  15. Schützen: Evaluating LLM Safety in Bulgarian and German Contexts

    Jun 9, 2026Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov +2LLM Safety BenchmarksMultilingual Language Model Evaluation

  16. Flaws in the LLM Automation Narrative

    Jun 9, 2026George Perrett, Javae Elliott, Jennifer Hill +1LLM EvaluationCode Generation

  17. PhantomBench: Benchmarking the Non-existential Threat of Language Models

    Jun 9, 2026Haeji Jung, Hila GonenLLM EvaluationHallucination in Language Models

  18. Janus: A Benchmark for Goal-Conditioned Information Distortion in LLMs

    Jun 9, 2026Polydoros Giannouris, Mohsinul Kabir, Sophia AnaniadouLLM EvaluationDeception in Language Models

  19. Are We Evaluating Knowledge or Phrasing? Mitigating MCQA Sensitivity with ParaEval

    Jun 9, 2026João Maria Janeiro, Mathurin Videau, Andrea Caciolai +3LLM EvaluationMultiple-Choice Question Answering

  20. Benchmarking Knowledge Editing using Logical Rules

    Jun 9, 2026Tatiana Moteu Ngoli, NDah Jean Kouagou, Hamada M. Zahera +1Knowledge EditingLLM Evaluation

  21. From Context-Aware to Conflict-Aware: Generalizing Contrastive Decoding for Knowledge Conflict in LLMs

    Jun 9, 2026Runze Jiang, Taiqiang Wu, Yan Wang +2LLM EvaluationKnowledge Conflicts in Language Models

  22. Benchmarking and Exploring the Capabilities of LLMs for Attack Investigations

    Jun 9, 2026Aniket Anand, Yiwei Hou, Daniel Fields +4LLM EvaluationCybersecurity

  23. RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning

    Jun 8, 2026Yiteng Mao, Kenan Xu, Yijia Lyu +3Mathematical Reasoning BenchmarksLLM Evaluation