LLM Evaluation

LLM: Large Language Model

Latest papers 1,631

All topics
CardsList
  1. Latent Confidence Alignment for LLM Self-Assessment

    Jun 20, 2026Ting-Yu Chen, Tingting Yu, Pei-Cing Huang +3LLM EvaluationConfidence Estimation in Language Models

  2. Fixed RAG Compression Collapses Measured Reader Scaling

    Jun 20, 2026Sugam Panthi, Rabab AbdelfattahRetrieval-Augmented GenerationLLM Evaluation

  3. LLM and Human Modes of Representation

    Jun 19, 2026Shalom LappinLLM EvaluationLLM Reasoning

  4. Rubric-as-Experts: Case-Specific MQM Rubrics for Translation Quality Evaluation

    Jun 19, 2026Weilu Xu, Yunzhi Shen, Xinye Wang +2LLM EvaluationRubric-Based Evaluation

  5. Finetuning with Scientific Data Increases Hallucinations: A Multi-domain Factuality Evaluation of LLMs

    Jun 19, 2026Raia Abu Ahmad, Nikolas Rauscher, Ekaterina Borisova +3LLM EvaluationLLM Fine-Tuning

  6. LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation

    Jun 19, 2026Xingyu Chen, Rui Wang, Zhaopeng Tu +1LLM EvaluationBenchmark Design

  7. Coherence Under Commitment: Probing Generalization and Vacuous Memorization in LLM Logical Reasoning

    Jun 19, 2026Noor Islam S. Mohammad, Mahmudul HasanLLM EvaluationReasoning Consistency in Language Models

  8. Comparing Transformers and Hybrid Models at the Token Level

    Jun 18, 2026Yanhong Li, William MerrillLLM EvaluationTransformer

  9. PeerCheck: Enhancing LLM-Generated Academic Reviews Towards Human-Level Quality

    Jun 18, 2026Zeyuan Chen, Ziqing Yang, Yihan Ma +2LLM EvaluationLLM Prompting

  10. CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes

    Jun 18, 2026Zhijian Zhou, Zesheng Ye, Zhaorun Chen +2LLM EvaluationAnytime-Valid Inference

  11. What Shapes Emergent Misalignment? Insights from Training Dynamics, Model Priors, and Data

    Jun 18, 2026Yuchen Zhang, Anietta Weckauff, Diego Garcia-Olano +1LLM EvaluationLLM Alignment

  12. QMFOL: Benchmarking Large Language Model Reasoning via Quantifiable Monadic First-Order Logic Test Case Generation

    Jun 18, 2026Xinyi Zheng, Ling Shi, Tianlong Yu +3Logical ReasoningLLM Evaluation

  13. Apparent Psychological Profiles of Large Language Models are Largely a Measurement Artifact

    Jun 18, 2026Jelena Meyer, David Garcia, Dirk U. WulffLLM EvaluationPersonality Modeling in Language Models

  14. BIM-Edit: Benchmarking Large Language Models for IFC-Based Building Information Modeling

    Jun 18, 2026Bharathi Kannan Nithyanantham, Clemens Kujat, Tobias Sesterhenn +5LLM EvaluationBuilding Information Modeling

  15. A Systematic Evaluation of Black-Box Uncertainty Estimation Methods for Large Language Models

    Jun 18, 2026Jiayi Wang, Xu-Yao ZhangLLM EvaluationUncertainty Quantification

  16. CombEval: A Framework for Evaluating Combinatorial Counting in Large Language Models

    Jun 18, 2026Yuxu Zhou, Ondřej Kuželka, Yuyi Wang +2LLM EvaluationLLM Reasoning

  17. NRITYAM: Language Models Meet Art and Heritage of Dance

    Jun 18, 2026Punit Kumar Singh, Niladri Ghosh, Advait Joshiınst +3Multilingual Language Model EvaluationLLM Evaluation

  18. Closing the Operational Gap in Semantic Caching

    Jun 18, 2026Aditeya Baral, Radoslav Ralev, Iliya Sotirov Zhechev +2LLM EvaluationCost-Aware Inference

  19. Hard or Just Unreached? Diagnosing the Sampling Blind Spot in Math-Reasoning Difficulty Estimation

    Jun 17, 2026Luca Zhou, Sajel Shah, Emanuele Rodolà +1Mathematical Reasoning BenchmarksLLM Evaluation

  20. Displacement Is Not Direction: Evaluating Fidelity Metrics for Quantized LLM Deployment

    Jun 17, 2026Miloš Nikolić, Ali Hadi Zadeh, Enrique Torres Sanchez +1LLM QuantizationLLM Evaluation

  21. Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias

    Jun 17, 2026Justin D. Norman, Michael U. Rivera, D. Alex HughesInter-Rater ReliabilityLLM Evaluation

  22. RECOM: A Validity Discrimination Tradeoff in Automatic Metrics for Open Ended Reddit Question Answering

    Jun 17, 2026Pushwitha Krishnappa, Amit Das, Vinija Jain +2Open-Ended GenerationLLM Evaluation

  23. G-IdiomAlign: A Gloss-Pivoted Benchmark for Cross-Lingual Idiom Alignment

    Jun 17, 2026Fengying Ye, Yanming Sun, Runzhe Zhan +3Figurative Language UnderstandingMultilingual Language Model Evaluation

  24. As Easy as Rocket Science: Assessing the Ability of Large Language Models to Interpret Negation in Figurative Language

    Jun 17, 2026Jasmine Owers, Edwin Simpson, Martha LewisFigurative Language UnderstandingPrompt Sensitivity

  25. RedactionBench

    Jun 17, 2026Sean Brynjólfsson, Shashvat Jayakrishnan, Esha Sali +2LLM EvaluationContextual Integrity

  26. RouteJudge: An Open Platform for Reproducible and Preference-Aware LLM Routing

    Jun 17, 2026Guannan Lai, Haoran Hu, Han-Jia YeLLM EvaluationPairwise Preference Evaluation