LLM Evaluation

LLM: Large Language Model

Latest papers 1,643

All topics
CardsList
  1. Assessing the Creativity of Large Language Models: Testing, Limits, and New Frontiers

    May 13, 2026Samuel Schapiro, Alexi Gladstone, Jonah Black +1Creativity AssessmentLLM Evaluation

  2. LLMs as annotators of credibility assessment in Danish asylum decisions: evaluating classification performance and errors beyond aggregated metrics

    May 13, 2026Galadrielle Humblot-Renaux, Mohammad N. S. Jahromi, Rohat Bakuri-Jørgensen +7Legal NLPLLM Evaluation

  3. PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users

    May 13, 2026Hannah Rose Kirk, Liu Leqi, Fanzhi Zeng +4LLM EvaluationLLM Sycophancy

  4. LLMs as Implicit Imputers: Uncertainty Should Scale with Missing Information

    May 13, 2026Stef van BuurenLLM EvaluationConfidence Estimation in Language Models

  5. TEMPO: Temporal Enforcement via Mode-Separated Policy Optimization for Trustworthy LLM Backtesting

    May 13, 2026Zeyu Zhang, Bradly C. StadieLLM EvaluationRL for Language Model Reasoning

  6. Simulating Students or Sycophantic Problem Solving? On Misconception Faithfulness of LLM Simulators

    May 12, 2026Heejin Do, Shashank Sonkar, Mrinmaya SachanLLM EvaluationLLM Sycophancy

  7. LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs

    May 12, 2026Zenghui Zhou, Man Li, Xiaoke Fang +3LLM EvaluationAutomated Software Testing

  8. Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models

    May 12, 2026Mohammed Saidul Islam, Negin Baghbanzadeh, Farnaz Kohankhaki +5LLM EvaluationBenchmark Design

  9. Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring

    May 12, 2026Jamshid Mozafari, Bhawna Piryani, Adam JatowtLLM Evaluation

  10. Scalable Token-Level Hallucination Detection in Large Language Models

    May 12, 2026Rui Min, Tianyu Pang, Chao Du +2LLM EvaluationHallucination in Language Models

  11. MedHopQA: A Disease-Centered Multi-Hop Reasoning Benchmark and Evaluation Framework for LLM-Based Biomedical Question Answering

    May 12, 2026Rezarta Islamaj, Robert Leaman, Joey Chan +13Multi-Hop QALLM Evaluation

  12. PreScam: A Benchmark for Predicting Scam Progression from Early Conversations

    May 12, 2026Weixiang Sun, Shang Ma, Yiyang Li +5LLM EvaluationCybersecurity

  13. MolDeTox: Evaluating Language Model's Stepwise Fragment Editing for Molecular Detoxification

    May 12, 2026Jueon Park, Wonjune Jang, Jiwoo Lee +2Molecular OptimizationLLM Evaluation

  14. PrivacySIM: Evaluating LLM Simulation of User Privacy Behavior

    May 12, 2026James Flemings, Murali AnnavaramLLM EvaluationUser Modeling

  15. SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation

    May 12, 2026Xiaoyuan Li, Yuzhe Wang, Moxin Li +6LLM EvaluationBenchmark Construction

  16. On the Limitations of Large Language Models for Conceptual Database Modeling

    May 12, 2026Arthur F. Siqueira, Carlos D. S. Nogueira, Eduarda Farias +2LLM EvaluationLLM Prompting

  17. On Predicting the Post-training Potential of Pre-trained LLMs

    May 12, 2026Xiaoyuan Li, Yubo Ma, Kexin Yang +5LLM EvaluationLanguage Model Post-Training

  18. How Well Do Large Language Models Capture Human Personality?

    May 12, 2026Aanisha Bhattacharyya, Yaman Kumar Singla, Rajiv Ratn Shah +2LLM EvaluationRepresentation Collapse

  19. Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity

    May 12, 2026Abid Ali, Diego Molla-Aliod, Usman NaseemLLM EvaluationMultimodal Large Language Models

  20. PRISM: A Geometric Risk Bound for Decomposing Drift into Scale, Shape, and Head

    May 12, 2026Chieh-Yen Lin, Shao-Hua SunLLM QuantizationLLM Evaluation

  21. DiffScore: Text Evaluation Beyond Autoregressive Likelihood

    May 12, 2026Wen Lai, Yingli Shen, Dingnan Jin +4LLM EvaluationLanguage Model Generation Evaluation

  22. Large Language Models for Causal Relations Extraction in Social Media: A Validation Framework for Disaster Intelligence

    May 12, 2026Ujun Jeong, Saketh Vishnubhatla, Bohan Jiang +3Relation ExtractionLLM Evaluation

  23. Predicting Psychological Well-Being from Spontaneous Speech using LLMs

    May 11, 2026Erfan Loweimi, Sofia de la Fuente Garcia, Saturnino LuzLLM EvaluationSpeech Processing

  24. Measuring Five-Nines Reliability: Sample-Efficient LLM Evaluation in Saturated Benchmarks

    May 11, 2026Eungyeup Kim, Chenchen Gu, Vashisth Tiwari +1LLM EvaluationLLM Reliability

  25. Benchmarking LLM-Based Static Analysis for Secure Smart Contract Development: Reliability, Limitations, and Potential Hybrid Solutions

    May 11, 2026Stefan-Claudiu Susan, Andrei Arusoaie, Dorel LucanuLLM EvaluationSoftware Vulnerability Detection

  26. Sampling More, Getting Less: Calibration is the Diversity Bottleneck in LLMs

    May 11, 2026Amin Banayeeanzade, Qingchuan Yang, Dhruv Tarsadiya +6LLM EvaluationLanguage Model Decoding