Large Language Model Evaluation

Latest papers 287

All topics
CardsList
  1. Validity Without Ground Truth: What Stated-Preference Economics Offers the Evaluation of Language Models

    Oct 7, 2026Daniel Robert Kling Alexander, Catherine Louise KlingLarge Language Model Evaluation

  2. LLM Persuasion Is in the Eye of the Evaluation

    Oct 7, 2026Kamile Dementaviciute, Julija Vaitonyte, Tijl De BiePersuasionLarge Language Model Evaluation

  3. The Missing Minimal Pair: Stereotype Evaluation in LLMs

    Oct 6, 2026Nataliya Stepanova, Ivan Titov, Emily Allaway +1Large Language Model BiasLarge Language Model Evaluation

  4. Does Steering Break Your Model? A Multi-Dimensional Evaluation Suite for LLM Steering Methods

    Oct 6, 2026Haotian Yang, Huikang Jiang, Yucheng Wu +4Linear Activation SteeringLarge Language Model Evaluation

  5. Dynamic Budget Allocation for LLM Evaluation under Hard Resource Constraints

    Oct 5, 2026Shai Feldman, Yaniv RomanoToken Budget AllocationLarge Language Model Evaluation

  6. Evaluating Whether GPT-6 Astra Performs Unsanctioned Supply-Chain Attacks

    Sep 29, 2026Alexandra Souly, Kai Fronsdal, Abby D'Cruz +2OpenaiLarge Language Model Evaluation

  7. A Proposed Rubric for Evaluating Expressed Clinical Reasoning in Large Language Model Responses

    Sep 29, 2026Zhangshu Joshua Jiang, Zina Ibrahim, James T. TeoRubricsTask-Specific Rubrics

  8. Mubric: Mutation Testing-Guided Rubric Generation for LLM Evaluation

    Sep 29, 2026Jiayuxuan Yang, Jie M. Zhang, Yiling Lou +1RubricsLarge Language Model Evaluation

  9. Breaking the Illusion of Review Reliability under Static Evaluation: SCOPE Fuzzing for LLM-based Scientific Reviewers

    Sep 29, 2026Zhuo Chen, Hao Zeng, Jiawei Liu +6Peer ReviewFuzzing

  10. JudgeProfile: Understanding and Steering Subjectivity in LLM Judges

    Sep 29, 2026Qi Cao, Kangning Liu, Xuan Kan +10Large Language Model JudgesJudgement

  11. Reliability Testing of Medical Model Performance under Distributed Deployment

    Sep 29, 2026Yifei Wang, Xiaohan Zhang, Youtao Ding +4Model EvaluationPre-Deployment Safety Assessments

  12. Training LLMs to Verbalize Evaluation Awareness

    Sep 28, 2026Usman Anwar, Sahar Abdelnabi, David KruegerVerbalizationLarge Language Model Evaluation

  13. OTROPE: Optimal Transport-based Robust Off-policy Evaluation for Large Language Models

    Sep 28, 2026Liner Xiang, Wenbo Zhang, Hengrui CaiLarge Language Model Evaluation

  14. How Well Can LLMs Simulate Real Learner Evaluations of Educational Feedback?

    Sep 28, 2026Momoka Furuhashi, Kouta Nakayama, Takashi Kodama +2Large Language Model EvaluationFeedback

  15. SleuthBench: Benchmarking Statistical LLM Evaluation Using Tabular Hidden Signals

    Sep 28, 2026Jingyun Jia, Antoine Remond-Tiedrez, Aaron Alvarez +3Large Language Model EvaluationModel Discovery

  16. Cultural Divergence Preservation: Diagnosing Flattening and Caricature in LLM-Simulated Survey Populations

    Sep 24, 2026Yeeun Chae, Yewon Choi, Seunghyun Lee +1Large Language Model EvaluationSurvey

  17. Calibration as a First-Class Criterion in LLM Evaluation

    Sep 22, 2026Mario Sanz-Guerrero, Katharina von der WenseLarge Language Model EvaluationOverconfidence

  18. Efficient Cost-Aware LLM Evaluation via Bayesian Bandit Gittins Indices

    Sep 22, 2026Qian Xie, Yueli He, Nairen CaoLarge Language Model EvaluationRecommendation

  19. Benchmarking LLM Compliance with China AI Generated Content Regulations

    Sep 17, 2026Chenrui Cui, Hongye Fang, Lisha Song +3Large Language Model EvaluationStrong Large Language Model

  20. Reproducibility is not construct validity: LLM measurement of institutionally situated communication

    Sep 17, 2026Veronika Batzdorfer, Carlo Romano Marcello Alessandro SantagiustinaInter-Annotator AgreementLarge Language Model Evaluation

  21. Monitoring and Discovering Reward Hacking with Internal Representations during LLM Evaluations

    Sep 16, 2026Leon Bergen, Usha Bhalla, Andrew Lee +15Large Language Model EvaluationReward Signal

  22. DyMT-ESB: Dynamic Multi-Turn Evaluation of Social Bias in User-LLM Interactions

    Sep 16, 2026Rem Hida, Masahiro Kaneko, Daisuke Oba +2Large Language Model BiasMulti-Turn Interactions

  23. Japanese Stroke LLM Evaluation: A Conversational Benchmark for Safe Stroke Care in Japanese Using Large Language Models

    Sep 15, 2026Keisuke Masuda, Kazutaka Yatsushiro, Hirohumi Iwamoto +2Large Language Model EvaluationStroke

  24. PRISMA-LLM: An Empirical Reporting Framework for AI-Assisted Systematic Reviews

    Sep 14, 2026Miguel Zabaleta, Baihan LinSystematic ReviewPeer Review

  25. A primer on evaluation methods for large language models in healthcare

    Sep 13, 2026Suzannah E McKinney, Phuc Vu, Samuel A Justice +7Large Language Model EvaluationHealthcare

  26. The widening evaluation gap in medical large language model research 2023 to 2026

    Sep 11, 2026Raad Bin Tareaf, Murad Al-Rajab, Samia LoucifSystematic ReviewLarge Language Model Evaluation

  27. Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation

    Sep 10, 2026Koutian Wu, Junjie Zhou, Ergan Shang +6Artificial Intelligence BenchmarksLarge Language Model Benchmarks

  28. The Audit Decides the Verdict: Instrument Effects Rival Demographic Bias in LLM Decision Audits

    Sep 8, 2026Siddharth Vohra, Manikandan RavikiranLarge Language Model BiasModel Auditing

  29. Evaluation of Contextual Understanding in Large Language Models

    Sep 8, 2026Subavarshana Arumugam, Mamta Nallaretnam, Kithuni Wickramasinghe +4Large Language Model EvaluationSimilarity and Metrics

  30. FLY-EVAL++: An Evidence-Driven Evaluation Protocol for Safety-Constrained Flight Prediction with Large Language Models

    Sep 3, 2026Yalun Wu, Junfeng Fang, Jiawei Wang +6Large Language Model EvaluationEvaluation Protocols

  31. Evaluating Criterion-Conditioned Behaviour of Large Language Models in Content Moderation

    Sep 3, 2026Danting Zhang, Bei Peng, Robert LoftinContent ModerationLarge Language Model Evaluation

  32. IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks

    Sep 3, 2026Saikat Mondal, Mamta, Deeksha Varshney +2Large Language Model SafetyLarge Language Model Evaluation

  33. SHELF: A Synthetic Harness for Multi-Task Bibliographic Benchmarking

    Sep 2, 2026Michael J. BommaritoLarge Language Model EvaluationTerm Frequency-Inverse Document Frequency

  34. A Tri-Agent Framework for Evaluating and Aligning Question Clarification Capabilities of Large Language Models

    Sep 2, 2026Yikai Zhao, Saurabh Pandey, Pradeep Kumar MisraClarificationLarge Language Model Evaluation

  35. CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-Training

    Sep 1, 2026Siyuan Li, Xinxin Song, Chen Ruinian +5Large Language Model Reinforcement LearningLarge Language Model Evaluation

  36. BLOOM-WILT: Logit Tilting for Behaviour Elicitation in Automated LLM Auditing

    Aug 31, 2026Adrians Skapars, Edoardo ManinoLarge Language Model EvaluationModel Auditing

  37. Can LLMs Take the Pulse of the Economy? A Real-Time Evaluation of LLM Nowcasts on Macroeconomic Indicators

    Aug 31, 2026Xinyue Zhao, Ruiyi Zhang, Liqin Ye +3Large Language Model ForecastingLarge Language Model Evaluation

  38. GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation

    Aug 30, 2026Yifan Chen, Haitao Li, Qingyao Ai +4RubricsLarge Language Model Evaluation

  39. Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance

    Aug 21, 2026Alexander Thomas, Hubert P. H. Shum, Darren Nellis +4Large Language Model EvaluationMaritime Navigation

  40. Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

    Aug 12, 2026Rodrigo Guedes de Souza, Alison R. PanissonLarge Language Model EvaluationReasoning Benchmark

  41. From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evaluation

    Aug 11, 2026Alireza S. Ziabari, Kat Ellis, Colleen Chan +1Sequential RecommendationLarge Language Model Evaluation

  42. EVIL-Detect for NLPCC 2026 Shared Task 6: LLM-Generated Text Detection

    Aug 11, 2026Hongrui Bao, Hangyu Rong, Zhuoshang Wang +2Machine-Generated Text DetectionLarge Language Model Evaluation

  43. Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases

    Aug 11, 2026Davood Wadi, Mohsen Ghodrat, Matthew PhilpLarge Language Model BiasLarge Language Model Evaluation

  44. Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation

    Aug 11, 2026Samaneh Mohtadi, Pietro Bernardelle, Joel Mackenzie +1Large Language Model EvaluationModel Judgments

  45. Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes

    Aug 10, 2026Alec Harris, Kasey Corra, Archie Chaudhury +1Large Language Model EvaluationLarge Language Model Alignment

  46. From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch

    Aug 10, 2026Laurens Samson, Iva Gornishka, Gossa Lô +2Large Language Model EvaluationLuxembourgish

  47. Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness

    Aug 10, 2026Tadanobu Chuyo Kamijo, Ori Rottenstreich, Javier Conde +2Large Language Model SafetyLarge Language Model Evaluation

  48. PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

    Aug 9, 2026Dongjie Xu, Julius, Hanchi Dong +6Large Language Model EvaluationDiagnostic Benchmark

  49. Taxonomy-Driven Analysis of Open-Source AI Risk Mitigation Tools

    Aug 7, 2026Afreen Alam, Evgenija Popchanovska, Ana Gjorgjevikj +4Artificial Intelligence RiskLarge Language Model Evaluation

  50. Recipes for Creativity: Iterative Generation and Evaluation in Large Language Models

    Aug 7, 2026Rens Anderson, Tessa Verhoef, Amirhossein ZohrehvandCreativityLarge Language Model Evaluation

  51. Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation

    Aug 5, 2026Bo Xue, Zhi Hong, Jiayi Li +3Cost-AwareLarge Language Model Evaluation

  52. Evaluating LLMs in Database Scenarios: A Lifecycle Benchmark for Assessing Their Potential in Core Database Tasks

    Aug 4, 2026Shunfan Zheng, Dongsheng Shi, Yue Li +3Text-To-SqlLarge Language Model Benchmarks

  53. Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Autonomous Experimental Design

    Aug 4, 2026Zejun Liu, Jian Wu, Ru Peng +4Large Language Model WorkflowsLarge Language Model Evaluation