LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. The Origins of Stochasticity: Comprehensive Investigations on Uncertainty Quantification for Large Language Models

    Jun 22, 2026Xiang-Jun Ou, Shuang Liang, Xin-Yu Hu +3LLM EvaluationUncertainty Quantification

  2. Language-Specific Sentiment Polarity Biases in Encoder and Large Language Model Classification of Product Reviews

    Jun 22, 2026Advita Rajiv, Kavitha Kothur, Gautham ReddyMultilingual Language Model EvaluationLLM Evaluation

  3. BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

    Jun 21, 2026João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz +2Multilingual Language Model EvaluationLLM Evaluation

  4. Safety-Aware Evaluation of LLM-Generated Driver Intervention Messages through Multi-Task Risk Fusion

    Jun 21, 2026Keito InoshitaLLM EvaluationAutonomous Driving

  5. Sub-Billion, Super-Frontier: Small Language Models Rival Zero-Shot Frontier LLMs on General and Literary Relation Extraction

    Jun 21, 2026Despina Christou, Grigorios TsoumakasRelation ExtractionLLM Evaluation

  6. PRIME: Evaluating Prompt Resolution Under Incompatible Instructions in LLMs

    Jun 21, 2026Tehreem Javed, Shumaim Fatimah, Masooma Bakhtiari +2LLM EvaluationLanguage Model Generation Evaluation

  7. CASPER in the Machine: Insights into Character Variety in LLM-Generated Stories

    Jun 21, 2026Anneliese Brei, Abhisheik Sharma, Nicholas Sanaie +2LLM EvaluationDiverse Text Generation

  8. Evaluating Large Language Models for Hausa and Fongbe Machine Translation: Benchmarks, Failures, and Metric Reliability

    Jun 20, 2026Mahounan Pericles Adjovi, Roald Eiselen, Prasenjit MitraLLM EvaluationLow-Resource MT

  9. Can LLMs Control Readability? A Multi-Dimensional Evaluation Framework for CEFR-Controlled Arabic Generation

    Jun 20, 2026Nour Rabih, Chatrine Qwaider, Ted BriscoeLLM EvaluationControllable Text Generation

  10. Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts

    Jun 20, 2026Jingting Zheng, Yuqi Ren, Linhao Yu +2LLM EvaluationLLM Alignment

  11. Latent Confidence Alignment for LLM Self-Assessment

    Jun 20, 2026Ting-Yu Chen, Tingting Yu, Pei-Cing Huang +3LLM EvaluationConfidence Estimation in Language Models

  12. Fixed RAG Compression Collapses Measured Reader Scaling

    Jun 20, 2026Sugam Panthi, Rabab AbdelfattahRetrieval-Augmented GenerationLLM Evaluation

  13. LLM and Human Modes of Representation

    Jun 19, 2026Shalom LappinLLM EvaluationLLM Reasoning

  14. Rubric-as-Experts: Case-Specific MQM Rubrics for Translation Quality Evaluation

    Jun 19, 2026Weilu Xu, Yunzhi Shen, Xinye Wang +2LLM EvaluationRubric-Based Evaluation

  15. Finetuning with Scientific Data Increases Hallucinations: A Multi-domain Factuality Evaluation of LLMs

    Jun 19, 2026Raia Abu Ahmad, Nikolas Rauscher, Ekaterina Borisova +3LLM EvaluationLLM Fine-Tuning

  16. LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation

    Jun 19, 2026Xingyu Chen, Rui Wang, Zhaopeng Tu +1LLM EvaluationBenchmark Design

  17. Coherence Under Commitment: Probing Generalization and Vacuous Memorization in LLM Logical Reasoning

    Jun 19, 2026Noor Islam S. Mohammad, Mahmudul HasanLLM EvaluationReasoning Consistency in Language Models

  18. Comparing Transformers and Hybrid Models at the Token Level

    Jun 18, 2026Yanhong Li, William MerrillLLM EvaluationTransformer

  19. PeerCheck: Enhancing LLM-Generated Academic Reviews Towards Human-Level Quality

    Jun 18, 2026Zeyuan Chen, Ziqing Yang, Yihan Ma +2LLM EvaluationLLM Prompting

  20. CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes

    Jun 18, 2026Zhijian Zhou, Zesheng Ye, Zhaorun Chen +2LLM EvaluationAnytime-Valid Inference

  21. What Shapes Emergent Misalignment? Insights from Training Dynamics, Model Priors, and Data

    Jun 18, 2026Yuchen Zhang, Anietta Weckauff, Diego Garcia-Olano +1LLM EvaluationLLM Alignment

  22. QMFOL: Benchmarking Large Language Model Reasoning via Quantifiable Monadic First-Order Logic Test Case Generation

    Jun 18, 2026Xinyi Zheng, Ling Shi, Tianlong Yu +3Logical ReasoningLLM Evaluation

  23. Apparent Psychological Profiles of Large Language Models are Largely a Measurement Artifact

    Jun 18, 2026Jelena Meyer, David Garcia, Dirk U. WulffLLM EvaluationPersonality Modeling in Language Models

  24. BIM-Edit: Benchmarking Large Language Models for IFC-Based Building Information Modeling

    Jun 18, 2026Bharathi Kannan Nithyanantham, Clemens Kujat, Tobias Sesterhenn +5LLM EvaluationBuilding Information Modeling