LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

    Jul 9, 2026Matteo Santelmo, Xiuying Wei, Israa Fakih +5VLM EvaluationLLM Evaluation

  2. ICDAR 2026 HIPE-OCRepair Competition on LLM-Assisted OCR Post-Correction for Historical Documents

    Jul 9, 2026Maud Ehrmann, Emanuela Boros, Juri Opitz +3Historical Document AnalysisLLM Evaluation

  3. From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs

    Jul 9, 2026Yi Zhang, Julia RayzLLM EvaluationComputer Science Education

  4. Validating LLMs in social science: Epistemic threats and emerging norms

    Jul 8, 2026Meera Desai, Dallas Card, Abigail Z. JacobsLLM EvaluationComputational Social Science

  5. Predicting LLM Safety Before Release by Simulating Deployment

    Jul 8, 2026Marcus Williams, Hannah Sheahan, Cameron Raymond +8LLM EvaluationAI Risk Management

  6. Measuring Intelligence Beyond Human Scale

    Jul 8, 2026Jerry Han, Rafael Moschopoulos, Ella Colby +6LLM EvaluationAI Agent Evaluation

  7. Comprehensive Evaluation of Large Language Model Responses: A Multi-Factor Scoring System

    Jul 8, 2026Yiming Gai, Junde Lu, Xuefei HuangLLM EvaluationQuestion Answering

  8. REFORGE: A Method for Benchmarking LLMs' Reverse Engineering Capabilities in Decompiled Binary Function Naming

    Jul 7, 2026Nicolas Koller, Andreas u. SchmidtLLM EvaluationSoftware Reverse Engineering

  9. Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities

    Jul 7, 2026So Hasegawa, Shailaja Keyur Sampat, Lei Liu +1Table QALLM Evaluation

  10. Evaluating Neural Decompilation of Dart AOT Binaries: Fine-Tuning, Metric Validity, Specification Leakage, and Reliability

    Jul 7, 2026Raafat Abualazm, Ayman AboElhassan, Amr G. WassalSoftware EngineeringLLM Evaluation

  11. Auto-DSM Under the Lens: A Black-Box Evaluation Framework for LLM-Based DSM Generation

    Jul 7, 2026Niels Potters, Theo HofmanLLM EvaluationLLM Auditing

  12. Integrating knowledge graphs and multilingual scholarly corpora for domain-adaptive LLMs in SSH

    Jul 7, 2026Adam Faci, Alessio Miaschi, Anne Combe +4Multilingual Language ModelsLLM Evaluation

  13. SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation

    Jul 7, 2026Yimeng Zhang, Yingying Zhuang, Ziyi Wang +12LLM EvaluationConfidence Estimation in Language Models

  14. BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension

    Jul 6, 2026Abu Tyeb Azad, Ishita Sur Apan, Fahim Ahmed +8Document UnderstandingLLM Evaluation

  15. CSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming

    Jul 6, 2026H. Chad Lane, Bryson KagelerLLM EvaluationIntelligent Tutoring Systems

  16. Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation

    Jul 6, 2026Sadia Kamal, Arefa Patwary, Anthony Marchiafava +2LLM EvaluationLanguage Model Generation Evaluation

  17. Rating the Pitch, Not the Product: User Evaluations of LLMs Reflect Expectations More Than Performance

    Jul 6, 2026Robert Morabito, Tyler McDonald, Charitra Viswanath +4Human Preference EvaluationLLM Evaluation

  18. Evaluating Large Language Models for Antisemitic Incident Classification

    Jul 6, 2026Karina Halevy, Julia Mendelsohn, Chan Young Park +2LLM EvaluationHate Speech Detection

  19. URSA: Chemistry-Aware Benchmark for Utilitarian Retrosynthesis Assessment

    Jul 6, 2026Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev +7LLM EvaluationLLM Planning

  20. Consistent but Miscalibrated: Evaluating LLM Limitations for Risk Communication in Natural Language

    Jul 4, 2026Diego Cerda-Mardini, Sarath Chandar, Sreenath MadathilLLM EvaluationProbability Calibration

  21. What Does a Routing Oracle Measure Under Stochastic Decoding? Coupling, Scorer Choice, and Single-Commit Ceilings

    Jul 3, 2026Teng-Ruei ChenLLM EvaluationLanguage Model Decoding

  22. Spectral Signatures of Large Language Models

    Jul 3, 2026Zhuoying Zhang, Ishan V. Prasad, Yuanzhe Hu +4LLM EvaluationLanguage Model Fingerprinting

  23. Which Algorithm Specification Formats Help Language Models Implement Machine Learning Algorithms?

    Jul 3, 2026Masahiro Kato, Taka KatoLLM EvaluationProgram Synthesis

  24. Silicon Sampling via Cross-Survey Transfer

    Jul 3, 2026Chan-Tung Ku, Chan Hsu, Pei-Cing Huang +3LLM EvaluationTransfer Learning