LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. VEHBench: A Stage-Local Diagnostic Benchmark for LLM-Assisted Vibration Energy Harvester Design

    Jul 20, 2026Depeng Su, Yuyu Luo, Guobiao HuLLM Evaluation

  2. Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints

    Jul 20, 2026Thomas MacDougall, Maksim Kuznetsov, Roman Schutski +5Constrained Generative ModelingLLM Evaluation

  3. WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting

    Jul 20, 2026Zhaokai Wang, Tianlin Gui, Jiayuan Rao +3LLM EvaluationForecasting Benchmarks

  4. Human Grounded Evaluation of Large Language Models for Optical Network Automation

    Jul 20, 2026Kiarash Rezaei, Omran Ayoub, Paolo Monti +1LLM Inference EfficiencyLLM Evaluation

  5. Pancasila-Dilemmas: Evaluating Large Language Models on Indonesian Human Value Dilemmas Grounded in Pancasila

    Jul 20, 2026Supryadi, Irfan, Julianti +4LLM EvaluationLLM Alignment

  6. Evaluating Federated Pre-Training: On the Reliability of Downstream Fine-Tuning and Intrinsic Evaluation

    Jul 20, 2026Claudia Grosser, Maike Heuer, Denis Krompass +1Language Model PretrainingLLM Evaluation

  7. HALLMARK: Diagnosing Three Failure Modes in LLM Citation Verifiers

    Jul 20, 2026Patrik Reizinger, Wieland BrendelLLM EvaluationCitation Verification

  8. Benchmarking Resource-Efficient LLMs for Research Topic Ontology Generation in the Biomedical Field

    Jul 20, 2026Tanay Aggarwal, Angelo Salatino, Francesco Osborne +1Relation ExtractionLLM Evaluation

  9. WuYu-EnvLE-Bench: A Benchmark for Evaluating Large Language Models in Environmental Law Enforcement

    Jul 20, 2026Ziliang Yang, Yi Zhang, Kaijun Lin +3LLM EvaluationLLM Grounding

  10. Large Language Models for Citation Function Classification

    Jul 20, 2026Daniel Vodička, Jakub Šmíd, Pavel Král +1LLM EvaluationLLM Fine-Tuning

  11. Efficient Sequential Evaluation of Large Language Models

    Jul 19, 2026Chia-Yu Hsu, Shubhanshu ShekharLLM EvaluationConfidence Estimation in Language Models

  12. A Systematic Evaluation of Traditional Privacy Policy Analysis Tools Against LLMs

    Jul 19, 2026Madhav Aryal, Sudipa Saha, Sunil Manandhar +2Privacy AuditingLLM Evaluation

  13. When LLMs Over-Answer: Measuring and Mitigating Quality Issues in LLM-Based Hardware Description Language Question Answering

    Jul 19, 2026Ziteng Hu, Jiachi Chen, Wenhao Lv +2LLM EvaluationElectronic Design Automation

  14. Encoding EEG Signals to Examine Human-Like Next-Word Prediction Behaviour in Language Models

    Jul 17, 2026Boi Mai Quach, Binh T. Nguyen, Cathal Gurrin +1LLM Evaluation

  15. StabilityBench: Benchmarking Instability in LLMs

    Jul 17, 2026Emma Kondrup, Zachary Yang, Anne Imouza +1LLM EvaluationLanguage Model Generation Evaluation

  16. Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning

    Jul 17, 2026Ajay Patel, Kartik Hosanagar, Ramayya Krishnan +2LLM EvaluationBenchmark Design

  17. Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery

    Jul 17, 2026Tianyun Zhong, Wangyi Jiang, Wei Wang +15LLM EvaluationScientific Hypothesis Generation

  18. Neuro-Symbolic AI for LEED compliance: Document-Centric Benchmarking, Deterministic Numeric Checking, and When Multimodal Hurts

    Jul 17, 2026Aritro De, Juliana FelknerLLM EvaluationNeuro-Symbolic AI

  19. Can We Trust Item Response Theory for AI Evaluation?

    Jul 16, 2026Han Jiang, Sunbeom Kwon, Jinwen Luo +2LLM EvaluationItem Response Theory

  20. How Well Does AI-Generated Feedback Work? Intrinsic and Extrinsic Evaluation across more than 20,000 EFL Essay Drafts

    Jul 16, 2026Steven Coyne, Diana Galvan-Sosa, Ryan Spring +4LLM EvaluationEducational Assessment