Model Evaluation

Latest papers 62

All topics
CardsList
  1. The Price of Correlated Tests: How Strict Should a Model Release Gate Be?

    Oct 1, 2026Marco PollanenReleaseGating

  2. A First Glance at Jev for Network Traffic Classification: Accuracy, Processing Time, and Cost

    Sep 30, 2026Shenghe Xu, Lifan MeiModel EvaluationCloud

  3. Reliability Testing of Medical Model Performance under Distributed Deployment

    Sep 29, 2026Yifei Wang, Xiaohan Zhang, Youtao Ding +4Model EvaluationPre-Deployment Safety Assessments

  4. Does Model Uncertainty Track Human Ambiguity? Evidence from Multi-Annotator Vision Benchmarks

    Sep 28, 2026Manya Singh, Arjun PakrashiAmbiguityMulti-Label Classification

  5. A Visual Classification Dataset and Model Evaluation for Historical Manuscript Illustrations

    Sep 27, 2026Yoav Evron, Michal Bar-Asher Siegal, Michael FireVision DatasetsHistorical Manuscripts

  6. Evaluating Explanation Methods by the Predictors They Induce

    Sep 17, 2026Jacob Selbæk, Hugo L. HammerShapley Additive ExplanationsExplainable AI Methods

  7. The widening evaluation gap in medical large language model research 2023 to 2026

    Sep 11, 2026Raad Bin Tareaf, Murad Al-Rajab, Samia LoucifSystematic ReviewLarge Language Model Evaluation

  8. Rethinking Sign Language Translation: The Impact of Signer Dependence on Model Evaluation

    Sep 7, 2026Keren Artiaga, Sabyasachi Kamila, Haithem Afli +2Gloss-Free Sign Language TranslationSign Language Translation

  9. Measuring consistency via ensemble margin and local prediction variability: Auditing decision systems in the presence of predictive multiplicity

    Sep 1, 2026Sinjini Banerjee, Tim Marrinan, Anand D. SarwateEnsembleModel Evaluation

  10. Incremental Evaluation and Training in Relational Deep Learning

    Aug 13, 2026Jakub Peleška, Gustav ŠírRelational Deep LearningRetraining

  11. Evaluating Machine Learning Models for Post-Wildfire Debris-Flow Prediction

    Aug 5, 2026Quinn Ledingham, Zhengsen Xu, Yimin Zhu +6Wildfire PredictionRainfall

  12. Dynamically Allocating Evaluation Effort for Model Ranking

    Aug 4, 2026Vilém Zouhar, Julia Kreutzer, Alon Lavie +4Model EvaluationEvaluation Benchmarks

  13. BayesAME: Bayesian Active Model Evaluation

    Jul 29, 2026Paula Cordero Encinar, Taylan Cemgil, Arnaud Doucet +2Geometry-Aware Uncertainty CoresetsModel Selection

  14. Enhancing Automated Machine Learning via Homogeneous Train-Test Splitting Methods

    Jul 29, 2026Yearn Tan Yin Tze, Charles GrelloisModel EvaluationBenchmark Datasets

  15. WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting

    Jul 20, 2026Zhaokai Wang, Tianlin Gui, Jiayuan Rao +3Large Language Model ForecastingModel Evaluation

  16. Can We Trust Item Response Theory for AI Evaluation?

    Jul 16, 2026Han Jiang, Sunbeom Kwon, Jinwen Luo +2Artificial Intelligence BenchmarksItem Response Theory

  17. Genre Bias or Aesthetic Perception? Identifying and Mitigating Shortcut Learning in Music Evaluation

    Jul 15, 2026Yizhou Zhang, Wangjin Zhou, Yi Zhao +3AestheticsModel Evaluation

  18. CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion

    Jul 6, 2026Adam Fisch, Daniel Deutsch, Joshua Maynez +5Model EvaluationMulti-Dimensional Evaluation

  19. HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data

    Jun 29, 2026Xinrui Ruan, Zhenyu Zhao, Waverly Wei +4Model EvaluationHuman Annotations

  20. Certification of Machine Learning Models via Directional Sharpness

    Jun 23, 2026Gefei Tan, Adria Gascon, Sarah Meiklejohn +1CertificationSharpness-Aware Minimization

  21. You Don't Need to Run Every Eval

    Jun 22, 2026Yuchen Zeng, Dimitris PapailiopoulosModel EvaluationFrontier Models

  22. MassSpecGym in the Wild: Uncovering and Correcting Evaluation Pitfalls in AI-Driven Molecule Discovery

    Jun 17, 2026Hongxuan Liu, Roman Bushuiev, Ivy Lightheart +12Tandem Mass SpectraMle-Bench Lite

  23. Model Stealing Through the Lens of Model Multiplicity

    Jun 13, 2026Eliott Baltz, Satoshi Hara, Ulrich AïvodjiSurrogatesModel Evaluation

  24. AfriSUD: A Dependency Treebank Collection for Evaluating Models on African Languages

    Jun 10, 2026Happy Buzaaba, Cheikh Mouhamadou Bamba Dione, David Ifeoluwa Adelani +15African LanguagesSyntactic Structure

  25. When Do Local Score Models Extrapolate Across Size? A Diagnostic Theory and Benchmark

    Jun 8, 2026Wenjie XiModel SizeExtrapolation

  26. Rank Intervals for Leaderboards: A Hierarchical Framework for Model Evaluation

    Jun 7, 2026Bitya Neuhof, Yuval BenjaminiModel EvaluationLeaderboard

  27. Hybrid CNN-LSTM Framework for Intelligent Cyber Attack Detection and Prevention in U.S. Critical Digital Infrastructure: A Comparative Machine Learning Evaluation on CSE-CIC-IDS2018

    Jun 4, 2026Md. Iqbal Hossan, Md. Serajul Kabir Chowdhury Rubel, Md. Arifur Rahman +1Threat DetectionIntrusion Detection

  28. GENEB: Why Genomic Models Are Hard to Compare

    Jun 3, 2026Daria Ledneva, Mikhail Nuridinov, Denis KuznetsovGenome-Wide Association StudyModel Evaluation

  29. TeachObs: A Human-Validated Benchmark for Multimodal Teaching Observation and Model Evaluation

    May 29, 2026Yeil Jeong, Youngjin Yoo, Jiyoung Bae +5Model Evaluation

  30. Who Am I? History-Aware Profiles for Student Simulation in Tutoring Dialogues

    May 28, 2026Zhangqi Duan, Shuyan Huang, Alexander Scarlatos +3User SimulationTutors

  31. A Full-Pipeline Framework for Evaluating Membership Inference Attacks in Machine Learning

    May 28, 2026Ding Chen, Xinwen Cheng, Xuyang Zhong +3Membership Inference AttacksModel Evaluation

  32. Semi-Supervised Hypothesis Testing by Betting on Predictions

    May 27, 2026Yaniv Tenzer, Elad Tolochinsky, Yaniv RomanoUnlabeled DataTwo-Sample Testing

  33. The Missing Piece in Pre-trained Model Evaluation: Reward-Guided Decoding Unlocks Task-Oriented Behavior Without Parameter Updates

    May 27, 2026Shaobo Wang, Guo Chen, Ziyue Wang +5PretrainingDecoding

  34. RULER: Representation-Level Verification of Machine Unlearning

    May 26, 2026Georgina Cosma, Axel FinkeMachine UnlearningRepresentation-Level Misalignment

  35. Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild

    May 22, 2026Zhimin Zhao, Zehao Wang, Abdul Ali Bangash +2Model EvaluationEngineering

  36. Learning to Evaluate: Cost-Effective Model Evaluation on Unlabeled Data with Meta-Learning

    May 22, 2026Trinh Pham, Viet Huynh, Hongzhi Yin +2Model EvaluationUnlabeled Data

  37. An Objective Performance Evaluation of the LSTM Networks in Time Series Classification

    May 19, 2026Sooraj Sunil, Balakumar BalasingamTime-Series ClassificationCnn-Lstm

  38. Training ML Models with Predictable Failures

    May 14, 2026Will Schwarzer, Scott NiekumEarly Failure PredictionPre-Deployment Safety Assessments

  39. NodeSynth: Socially Aligned Synthetic Data for AI Evaluation

    May 14, 2026Qazi Mamunur Rashid, Xuan Yang, Zhengzhe Yang +5Synthetic DataGenerative Artificial Intelligence

  40. A Transfer Learning Evaluation of Deep Neural Networks for Image Classification

    May 12, 2026Nermeen Abou Baker, Nico Zengeler, Uwe HandmannTransfer LearningPretraining

  41. Slum Detection and Density Mapping with AlphaEarth Foundations: A Representation Learning Evaluation Across 12 Global Cities

    May 11, 2026Shuyang Hou, Ziqi Liu, Haoyue Jiao +7Geospatial Foundation ModelsUrban Environments

  42. FLAM: Evaluating Model Performance with Aggregatable Measures in Federated Learning

    May 8, 2026Fabian Stricker, Jose A. Peregrina, David Bermbach +1Federated LearningModel Evaluation

  43. Query-efficient model evaluation using cached responses

    May 8, 2026Hayden Helm, Ben Johnson, Carey PriebeModel EvaluationResponses

  44. Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions

    May 7, 2026Chengjie Wang, Jingzheng Wu, Xiang Ling +2Vulnerable CodeCode Quality

  45. Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone

    May 6, 2026Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka +1Model EvaluationArtificial Intelligence Alignment

  46. Sentiment Analysis of Mobile Legends App Reviews Using Machine Learning and LSTM-Based Deep Learning Models

    May 2, 2026Vira Putri Maharani, Kharisa Harvanny, Daris Samudra +3SentimentTerm Frequency-Inverse Document Frequency

  47. Measuring the Sensitivity of Classification Models with the Error Sensitivity Profile

    Apr 28, 2026Andrea MaurinoFeature ImportanceModel Evaluation

  48. PLMGH: What Matters in PLM-GNN Hybrids for Code Classification and Vulnerability Detection

    Apr 28, 2026Mohamed Taoufik Kaouthar El Idrissi, Edward Zulkoski, Mohammad HamdaqaGnn-Based DetectorsGraph Neural Networks

  49. SCURank: Ranking Multiple Candidate Summaries with Summary Content Units for Enhanced Summarization

    Apr 21, 2026Bo-Jyun Wang, Ying-Jia Lin, Hung-Yu KaoSummarizationLarge Language Model Reranking

  50. FLARE: Task-agnostic embedding model evaluation through a normalization process

    Apr 19, 2026Jingzhou Jiang, Yixuan Tang, Yi Yang +1Model EvaluationLatent Flow

  51. Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks

    Apr 18, 2026Tyler H. Merves, Michael H. Conaway, Joseph M. Escobar +2Attacker Large Language ModelLarge Language Model Agents

  52. DEEP-GAP: Deep-learning Evaluation of Execution Parallelism in GPU Architectural Performance

    Apr 16, 2026Kathiravan PalaniappanNvidiaEfficient Inference

  53. The Benchmarking Epistemology: Validity Theory for Evaluating Machine Learning Models

    Oct 27, 2025Timo Freiesleben, Sebastian ZezulkaModel EvaluationEpistemic State Replication

  54. Perspective of Software Engineering Researchers on Machine Learning Practices Regarding Research, Review, and Education

    Nov 28, 2024Anamaria Mojica-Hanke, David Nader Palacio, Denys Poshyvanyk +2Software EngineeringModel Evaluation