LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Predicting Inference-Time Scaling Gains from Labeled Validation-Set Output Statistics

    Jun 2, 2026Luyang Zhang, Jingyan LiLLM EvaluationInference-Time Scaling

  2. Linguistic Productivity in Large Language Models: Models Coerce, but do not Preempt

    Jun 1, 2026Claire Bonial, Claire Benet Post, Laura Michaelis +1LLM EvaluationLanguage Modeling

  3. Thinking Past the Answer: Evaluating Harmful Overthinking in Large Reasoning Models

    Jun 1, 2026Simone Caldarella, Davide Talon, Rahaf Aljundi +2LLM EvaluationOverthinking in Language Models

  4. Translating Classical Poetry into Modern Prose

    Jun 1, 2026Chalamalasetti Kranti, Sowmya VajjalaLLM EvaluationMachine Translation

  5. Greener Than Humans? Environmental Attitudes in Large Language Models

    Jun 1, 2026Stefanie Kunkel, Tilman Hartwig, Marcus Voss +2LLM EvaluationLanguage Model Robustness

  6. LLMs as Teaching Assistants for Mathematics Exam Grading: Reliability, and Practical Usability

    Jun 1, 2026Aastha Sapkota, M. G. Sarwar MurshedLLM EvaluationLLM-as-a-Judge

  7. K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

    Jun 1, 2026Nahyun Lee, Dongkeun Yoon, Guijin Son +12Computer-Use Agent BenchmarksLLM Evaluation

  8. CARTE: A Benchmark for Mapping Language Model Knowledge Across France

    Jun 1, 2026Sarah Almeida Carneiro, Christos Xypolopoulos, Xiao Fei +2LLM EvaluationFactual Knowledge in Language Models

  9. What to Format and How: A Benchmark and Workflow Approach for Document Formatting

    Jun 1, 2026Shihao Rao, Liang Li, Jiapeng Liu +6LLM EvaluationDocument Layout Analysis

  10. CultureForest: Understanding and Evaluating Cultural Norm Grounded Reasoning in LLMs

    Jun 1, 2026Yangfan Ye, Xiaocheng Feng, Jialong Tang +5LLM EvaluationCultural Bias in Language Models

  11. Does Compression Preserve Uncertainty? A Unified Benchmark for Quantized and Sparse LLMs via Conformal Prediction

    Jun 1, 2026Yujia Tong, Yuxi Wang, Yunyang Wan +3LLM QuantizationLLM Evaluation

  12. Unveiling the Limits of Large Language Models in Inferring Pragmatic Meaning from Non-Verbal Responses

    Jun 1, 2026Sugyeong Eo, Heuiseok LimLLM EvaluationPragmatic Reasoning in Language Models

  13. Argument Collapse: LLMs Flatten Long-Form Public Debate

    Jun 1, 2026Yekyung Kim, Yapei Chang, Chau Minh Pham +1LLM EvaluationComputational Argumentation

  14. Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation

    Jun 1, 2026Junjie Chen, Yuxi Dong, Haitao Li +5LLM EvaluationLLM-as-a-Judge

  15. Question Type, Cognitive Load, and CEFR Alignment: Evaluating LLM-Generated EFL Grammar Drill Exercises

    Jun 1, 2026Steve Woollaston, Brendan Flanagan, Yuko Toyokawa +1LLM Evaluation

  16. Truthful AI Advisors: A Pre-Specified Benchmark for Large Language Model Honesty Under Preference Misalignment

    May 31, 2026Hamidreza Hasani Balyani, Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi +2LLM EvaluationLLM Alignment

  17. Before and After Temperature: A Distributional View of Creative LLM Generation

    May 31, 2026V. S. Raghu Parupudi, Harsha Ponnada, Aditi Kaushal +3Open-Ended GenerationCreativity Assessment

  18. Consistent and Distinctive: LLM Benchmark Efficiency via Maximum Independent Set Prompt Selection on Similarity Graphs

    May 31, 2026Denica Kjorvezir, Marko Djukanović, Ana Gjorgjevikj +2LLM Evaluation

  19. Benchmarking Local LLMs for Natural-Language-to-SQL Querying in Biopharmaceutical Manufacturing: An Empirical Benchmark on Consumer-Grade Hardware

    May 31, 2026Sagar Bhetwal, Rajan Bastakoti, Nirajan Acharya +2LLM EvaluationLLM Inference

  20. The Case for Model Science: Verify, Explore, Steer, Refine

    May 31, 2026Przemyslaw Biecek, Luca Longo, Jianlong Zhou +3LLM EvaluationLLM Interpretability

  21. Diagnosing LLM Arbitration Behavior over Pre-evidence Epistemic States in RAG-based Fact-Checking

    May 31, 2026Yuxi Sun, Wenbo Shang, Wei Gao +2Retrieval-Augmented GenerationLLM Evaluation

  22. Child-directed speech facilitates production, not comprehension, in BabyLMs

    May 31, 2026Bastian Bunzeck, Sina ZarrießLanguage Model PretrainingLLM Evaluation

  23. Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks

    May 30, 2026Yongxi Zhou, Lai Yun Choi, Jiaxi Wen +1LLM EvaluationLanguage Model Generation Evaluation

  24. IDEAFix: Evaluation Framework for Creative Defixation Prompting in LLMs

    May 30, 2026F. Carichon, S. Sharma, M. Girard +2Creativity AssessmentLLM Evaluation

  25. RWGBench: Evaluating Scholarly Positioning in Related Work Generation

    May 30, 2026Anzhe Xie, Weihang Su, Jiaxin Mao +4LLM EvaluationAutomated Evaluation

  26. Finite Certificates for In-Context Determinacy and a Threshold Theory of Emergence in Language Models

    May 30, 2026Faruk Alpay, Hamdi AlakkadLLM EvaluationIn-Context Learning

  27. On the Limits of LLM Adaptability: Impact of Model-Internalized Priors on Annotation Task Performance

    May 30, 2026Etienne Casanova, Rafal Kocielnik, R. Michael AlvarezLLM EvaluationZero-Shot Text Classification

  28. ProtStructQA: A Denotation Threshold in Protein Structural Reasoning

    May 30, 2026Aravind Mandiga, Guoming Li, Jin Lu +3LLM EvaluationScientific QA