Evaluation Protocols

Momentum

9 papers in the last four weeks, up 80% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 45

All topics
CardsList
  1. MIRTO: a registration-gated, multiverse-tested evaluation protocol for unsupervised anomaly segmentation in brain MRI

    Oct 1, 2026Negin Kafee Hernashki, Soumick ChatterjeeFunctional Magnetic Resonance ImagingGraph Anomaly Detection

  2. Evaluating Physical Consistency and Plausibility in Generative Scenario Models for Autonomous Driving

    Oct 1, 2026Manasa Mariam Mammen, Zafer Kayatas, Stefan WagnerScenario GenerationAutonomous Driving

  3. PhysioTRACE: Provenance-Aware Stress Tests for Physiological Foundation Models

    Sep 28, 2026Ayana Mussabayeva, Anuar Aimoldin, Olivier Oullier +2Physiological DataElectroencephalography Foundation Models

  4. Robust to Which Model Change? A Unified Evaluation of Robust Counterfactual Explanations

    Sep 25, 2026Marcin Kostrzewa, Maciej ZiębaCounterfactual ExplanationRobustness Verification

  5. Mitigating Sequential Reappearance in Diffusion Data-Point Unlearning

    Sep 21, 2026Donghyun Kim, Taehyuk Lee, Jinyeong Kim +4DeletionRetraining

  6. Accountable and uncertainty-aware evaluation of sensor-based AI under distribution shift: devices, subjects, and nearly three years underground

    Sep 8, 2026Benny Platte, Rico Thomanek, Christian Roschke +1Artificial Intelligence EvaluationEvaluation Protocols

  7. The Unreliable Progress Bar: Can LLM Agents Reliably Report Task Progress Throughout Execution?

    Sep 8, 2026Boyang Wang, Yunhan Wang, Yalun WuLarge Language Model AgentsNew Tasks

  8. FLY-EVAL++: An Evidence-Driven Evaluation Protocol for Safety-Constrained Flight Prediction with Large Language Models

    Sep 3, 2026Yalun Wu, Junfeng Fang, Jiawei Wang +6Large Language Model EvaluationEvaluation Protocols

  9. Toward Workflow-Aware Benchmarking for Healthcare NLP Agents

    Aug 31, 2026Junyi Yao, Baichuan Li, Zihao Zheng +1Evaluation ProtocolsClinical Notes

  10. Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation

    Aug 13, 2026Junhao Luo, Ning Huang, Ziqi Sha +2Evaluation ProtocolsModel Auditing

  11. Labels Are Not Endpoints: Treatment Leakage and Construct Validity in MCP Agent Security Evaluation

    Aug 13, 2026Rana Muhammad Ahmed, Sabahat AbbasSecurity EvaluationModel Auditing

  12. SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

    Aug 8, 2026Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah +11Multilingual SafetyLarge Language Model Safety

  13. How Benchmarks and Evaluation Protocols Shape Conclusions in Provenance-Based Intrusion Detection

    Aug 2, 2026Lorenzo Guerra, Thomas Chapuis, Guillaume Duc +2Intrusion DetectionEvaluation Protocols

  14. Checkpoint Selection and Evaluation in EEG Emotion Recognition

    Jul 30, 2026Hanting Suo, Hongxun Wang, Yuwen LiElectroencephalographyEmotion Recognition

  15. ReCowGnition: A Realistic Biometric Benchmark for Cow Face Recognition

    Jul 24, 2026Marco Huber, Marco Kiesewalter, Judith Louise Pieper +2Face Recognition ModelAnimal Re-Identification

  16. Evaluation Protocols and Validation for Cameras in Indoor Healthcare Monitoring

    Jun 24, 2026Amirhossein Dadashzadeh, Jingjing Liu, Qianhui Men +5CameraRgb-Depth Cameras

  17. When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

    Jun 22, 2026Yanhang Li, Zhichao Fan, Zexin ZhuangIndirect Prompt InjectionMultimodal Evaluation

  18. LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings

    Jun 16, 2026Yi Zhao, Zhen Yang, Mengpan Chen +5WebRecent Vision-Language Models

  19. WHAR Arena: Benchmarking the State of the Art in Efficient Wearable Human Activity Recognition

    Jun 11, 2026Maximilian Burzer, Tobias King, Till Riedel +2Human Activity RecognitionDeep Learning

  20. Causally Evaluating the Learnability of Formal Language Tasks

    Jun 8, 2026Vésteinn Snæbjarnarson, Anej Svete, Josef Valvoda +3Legal Natural Language Processing BenchmarksLearnability

  21. A Komi-Yazva--Russian Parallel Corpus and Evaluation Protocol for Zero- and Few-Shot LLM Translation

    Jun 4, 2026Petr ParshakovText CorporaEvaluation Protocols

  22. Measuring Progress Toward AGI: A Cognitive Framework

    May 27, 2026Ryan Burnell, Yumeya Yamamori, Orhan Firat +10General IntelligenceCognitive Science

  23. From paper to benchmark: agentic, framework-based reproduction of under-specified methods in machine health intelligence

    May 27, 2026Raffael Theiler, Ludovico Comito, David Leko +3ReproducibilityMle-Bench Lite

  24. Pointwise Metrics Mislead: An Evaluation Protocol for Multimodal Inverse Problems

    May 21, 2026Mads H. Baattrup, Jörn Bach, Laurids Jeppe +4Inverse ProblemCalibrated Uncertainty

  25. Agentic Trading: When LLM Agents Meet Financial Markets

    May 19, 2026Yihan Xia, Panpan You, Taotao Wang +4Large Language Model AgentsEvaluation Protocols

  26. From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World

    May 11, 2026Pedro Conde, Henrique Branquinho, Valerio Mazzone +3Penetration TestingCyberattacks

  27. Acceptance Cards:A Four-Diagnostic Standard for Safe Fine-Tuning Defense Claims

    May 11, 2026Phongsakon Mark Konrad, Toygar Tanyel, Serkan AyvazLarge Language Model SafetyModel Fine-Tuning

  28. Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

    May 8, 2026Zhengyang Tang, Yi Zhang, Chenxin Li +18Safety BenchmarksUnsafe

  29. Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

    May 8, 2026Saloni Garg, Amit SagtaniLarge Language Model RoutingLarge Language Model Evaluation

  30. How VLAs (Really) Work In Open-World Environments

    Apr 23, 2026Amir Rasouli, Yangzheng Wu, Zhiyuan Li +4Evaluation ProtocolsLong-Horizon Task Planning

  31. Toward Efficient Agents: Memory, Tool learning, and Planning

    Jan 20, 2026Xiaofang Yang, Lijun Li, Heng Zhou +12Production Agentic SystemsEfficiency

  32. DHAuDS: A Dynamic and Heterogeneous Audio Benchmark for Test-Time Adaptation

    Nov 23, 2025Weichuang Shao, Iman Yi Liao, Tomas Henrique Bode Maul +1Test-Time AdaptationEvaluation Protocols

  33. What does the model actually see? Evaluation protocols and input availability in data-driven prediction of room acoustic parameters

    Date pendingAk\in OktavAcousticEvaluation Protocols