LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models

    Jun 25, 2026Henry Shaowu Yuchi, Michal Kucer, Benjamin H. Sims +2LLM EvaluationScientific QA

  2. The Capability Frontier: Benchmarks Miss 82% of Model Performance

    Jun 25, 2026Bradley Fowler, Ryan Smith, Daniel Thi Graviet +8LLM EvaluationLanguage Model Generation Evaluation

  3. Empirical Software Engineering TerraProbe: A Layered-Oracle Framework for Detecting Deceptive Fixes in LLM-Assisted Terraform

    Jun 25, 2026Manar Alsaid, Chimdumebi Nebolisa, Faris AbbasLLM EvaluationAutomated Program Repair

  4. Can Large Language Models Reliably Code Qualitative Humanitarian Data? A Benchmark Study Against Human Expert Adjudication

    Jun 25, 2026Jerome Marston, Tino Kreutzer, Salomé Garnier +3LLM EvaluationHuman-in-the-Loop Annotation

  5. An Empirical Study of LLM-Generated Specifications for VeriFast

    Jun 25, 2026Wen Fan, Minh Tran, Sanya Dod +5LLM EvaluationFormal Verification

  6. DualEval: Joint Model-Item Calibration for Unified LLM Evaluation

    Jun 24, 2026Aaron J. Li, Hao Huang, Youngmin Park +6LLM EvaluationLanguage Model Generation Evaluation

  7. Estimating Uncertainty in Classifier Performance with Applications to Large Language Models and Nested Data

    Jun 24, 2026Kylie AnglinLLM EvaluationConfidence Region Estimation

  8. InvestPhilBench: A Multi-Layer Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy

    Jun 24, 2026Mingguang Chen, Bo QuLLM EvaluationFinance

  9. Manipulation Is Task-Dependent: A Multi-Axis, Multi-Environment Evaluation of Frontier LLMs

    Jun 24, 2026Adeeb Zaman, Erik Nordby, Fred HeidingLLM EvaluationLanguage Model Safety Evaluation

  10. Recall Before Rerank: Benchmarking Deep Learning Models for Large-Scale Code-to-Code Retrieval

    Jun 24, 2026Leonardo Venuta, Francesco Tosoni, Paolo FerraginaLLM EvaluationSemantic Search

  11. Evaluating LLMs on Real-World Software Performance Optimization

    Jun 24, 2026Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim +1Software EngineeringLLM Evaluation

  12. A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

    Jun 24, 2026Abrar Alotaibi, Raed Mughus, Moataz AhmedMultilingual Language Model EvaluationLLM Evaluation

  13. Accuracy and Satisfaction in Multi-Turn LLM Dialogues for NFR Assessment

    Jun 23, 2026Ali Pourghasemi Fatideh, Wilder Baldwin, Maria Dhakal +2Requirements EngineeringLLM Evaluation

  14. On the Stability of Prompt Ranking in Large Language Model Evaluation

    Jun 23, 2026Shaoshuai Du, Penghao Liang, Yixian Shen +3LLM EvaluationLLM Prompting

  15. Transformer-Based Language Models Across Domain Verticals: Architectures, Applications and Critical Assessment

    Jun 23, 2026Guruprakash J, Krithika L. BLLM EvaluationLLM Alignment

  16. CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression

    Jun 23, 2026Morayo Danielle Adeyemi, Ryan A. Rossi, Franck DernoncourtLLM EvaluationLLM Compression

  17. You Don't Need to Run Every Eval

    Jun 22, 2026Yuchen Zeng, Dimitris PapailiopoulosLLM EvaluationMatrix Completion

  18. TriggerBench: Investigating Prospective Memory for Large Language Models

    Jun 22, 2026Tianhua Zhang, Xinjiang Wang, Qianxi Zhang +6LLM EvaluationLong-Context Language Model Evaluation

  19. HOLMES: Evaluating Higher-Order Logical Reasoning in LLMs

    Jun 22, 2026Yucheng Wu, Jundong Xu, Mingzhen Ju +4Logical ReasoningLLM Evaluation

  20. When Does Intrinsic Self-Correction Help? A Task-Sensitive Analysis

    Jun 22, 2026Elroy Stav, Dvir Berlowitz, Maayan Orner +1LLM Self-CorrectionLLM Evaluation

  21. Who Owns the AI Recommendation? A Multi-Industry Empirical Map of Brand Category Ownership Across Large Language Models

    Jun 22, 2026Dmitrij ŻatuchinLLM EvaluationLLM Auditing

  22. StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs

    Jun 22, 2026Youxin Zhu, Yixuan Ding, Peng Lai +3LLM EvaluationAI Agent Benchmarks

  23. MINCE: Shrinking LLM Evaluation Datasets via Few-Model Monte Carlo Calibration

    Jun 22, 2026Devleena Das, Rajeev Patwari, Vikram Kumar Bukka +3LLM Evaluation

  24. Measuring Behavior Portability in Large Language Models

    Jun 22, 2026Tianjia Dong, Nadav Kunievsky, James A. EvansLLM EvaluationLLM Decision-Making