LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models

    May 3, 2026Ranit Karmakar, Jayita ChatterjeeLLM EvaluationLanguage Model Calibration

  2. Conventional Commit Classification using Large Language Models and Prompt Engineering

    May 3, 2026H. M. Sazzad Quadir, Sakib Al Hasan, Md. Nurul Ahad TawhidSoftware EngineeringLLM Evaluation

  3. Language models fail at extended rule following

    May 3, 2026Tianxiang Dai, Jonathan FanLLM EvaluationLLM Reliability

  4. StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models

    May 3, 2026Yongrui Chen, Yangyang Ma, Xiaoying Huang +4LLM EvaluationBenchmark Design

  5. Spatiotemporal Hidden-State Dynamics as a Signature of Internal Reasoning in Large Language Models

    May 3, 2026Kotaro Furuya, Takahito TanimuraTransformer InterpretabilityLLM Evaluation

  6. RMGAP: Benchmarking the Generalization of Reward Models across Diverse Preferences

    May 3, 2026Yangyang Zhou, Yi-Chen LiReward ModelingLLM Evaluation

  7. Molecular Representations for Large Language Models

    May 3, 2026Nicholas T. Runcie, Fergus Imrie, Charlotte M. DeaneLLM EvaluationLarge Language Model-Guided Scientific Discovery

  8. Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

    May 2, 2026Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida +6LLM EvaluationLLM-as-a-Judge

  9. Evaluating LLMs on Large-Scale Graph Property Estimation via Random Walks

    May 2, 2026Sunil Kumar Maurya, Xin LiuLLM EvaluationLLM Reasoning with Graphs

  10. Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks

    May 2, 2026Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer +32LLM EvaluationHealthcare

  11. Structural Ranking of the Cognitive Plausibility of Computational Models of Analogy and Metaphors with the Minimal Cognitive Grid

    May 2, 2026Alessio Donvito, Antonio LietoLLM EvaluationComputational Cognitive Modeling

  12. On Stable Long-Form Generation: Benchmarking and Mitigating Length Volatility

    May 2, 2026Zhitao He, Haolin Yang, Rui Min +2LLM EvaluationLong-Form Document Generation

  13. Psychologically Potent, Computationally Invisible: LLMs Generate Social-Comparison-Eliciting Posts They Fail to Detect

    May 1, 2026Hua Zhao, Jiapei Gu, Michelle Mingyue GuSocial Media AnalysisLLM Evaluation

  14. Can AI Debias the News? LLM Interventions Improve Cross-Partisan Receptivity but LLMs Overestimate Their Own Effectiveness

    May 1, 2026Faisal Feroz, Jonas R. KunstLLM EvaluationHuman Behavior Simulation

  15. When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models

    May 1, 2026Sailesh Panda, Pritam Kadasi, Abhishek Upperwal +1LLM EvaluationInstruction Following

  16. Seeking Information with RAG-Assistants: Does Model Size Matter in Human-AI Collaborations?

    May 1, 2026Lennard C. Froma, Tom Kouwenhoven, Maaike H. T. de Boer +2LLM EvaluationLanguage Model Scaling

  17. Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs

    May 1, 2026Jasper Dekoninck, Nikola Jovanović, Tim Gehrunger +4Mathematical Reasoning BenchmarksLLM Evaluation

  18. Token Arena: A Continuous Benchmark Unifying Energy and Cognition in AI Inference

    May 1, 2026Yuxuan Gao, Megan Wang, Yi Ling YuLLM EvaluationEnergy-Efficient ML

  19. Estimating LLM Grading Ability and Response Difficulty in Automatic Short Answer Grading via Item Response Theory

    Apr 30, 2026Longwei Cong, Sonja Hahn, Sebastian Gombert +3LLM EvaluationAutomated Grading

  20. Investigating LLM's Problem Solving Capability -- a Study on Statics Questions

    Apr 30, 2026Tanner Culleton, Hung-Fu ChangLLM EvaluationPhysical Reasoning

  21. TopBench: A Benchmark for Implicit Predictive Reasoning in Tabular Question Answering

    Apr 30, 2026An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan +1Table QALLM Evaluation

  22. Taming the Centaur(s) with LAPITHS: a framework for a theoretically grounded interpretation of AI performances

    Apr 30, 2026Matteo Da Pelo, Alessio Donvito, Claudio Frongia +2LLM EvaluationComputational Cognitive Modeling

  23. Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future

    Apr 30, 2026Sihong Wu, Owen Jiang, Yilun Zhao +5LLM EvaluationScholarly Peer Review

  24. Test Before You Deploy: Governing Updates in the LLM Supply Chain

    Apr 30, 2026Mohd Sameen Chishti, Damilare Peter Oyinloye, Jingyue LiLLM EvaluationLLM Auditing

  25. RuC: HDL-Agnostic Rule Completion Benchmark Generation

    Apr 30, 2026Arnau Ayguadé Domingo, Miquel Alberti-Binimelis, Cristian Gutierrez-Gomez +5LLM EvaluationLLM Prompting