Evaluation Benchmarks

Momentum

9 papers in the last four weeks, up 125% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 91

All topics
CardsList
  1. PlaySuite: A Large-Scale Benchmark for Interactive Visual Intelligence

    Oct 5, 2026Dheeraj Varghese, Anna Vettoruzzo, Walter Simoncini +5Evaluation BenchmarksVideo World Models

  2. VisionQ: VLM-as-a-Judge Taxonomy, Dataset and Benchmark for Qualitative Analysis in Computer Vision

    Sep 30, 2026Vu Dinh Xuan, Duc-Hai Nguyen, Minh-Dung Dao +6Visual Question Answering BenchmarksEvaluation Benchmarks

  3. Eval4DiRec: A Unified and Systematic Evaluation Framework for Diffusion-based Recommender Systems

    Sep 28, 2026Cong Wang, Shoujin Wang, Yishuo Li +3Real-World Content Recommendation ProblemEvaluation Benchmarks

  4. AgentBoundary: Counterfactual Evaluation of Safety in Tool-Using LLM Agents

    Sep 27, 2026Tianzhuo Yang, Zirui Mi, Yantao Huang +4RefusalsEvaluation Benchmarks

  5. ReVeal: A Reconstruction-Aware Real-to-Sim Framework for VLA Policy Evaluation

    Sep 20, 2026Xinyi Wang, Heng Hao, Wenjun Hu +5Simulation-Based Reinforcement LearningEvaluation Benchmarks

  6. Towards Reliable Underwater Diver-Robot Interaction: Gesture Design, Interaction Logic, and Real-World Evaluation

    Sep 20, 2026Yingqi Liu, Kanzhong Yao, Zimeng Peng +4Underwater RobotsUnderwater

  7. Behavior2Value: Benchmarking and Empowering LLMs for Consumer Value Measurement from E-commerce Behaviors

    Sep 16, 2026Peixuan Hou, Bin Chen, Li He +4ConsumptionValue

  8. Do LLMs Trust the Accuser or the Accusation? Measuring Belief Shifts in Werewolf

    Sep 14, 2026Yu-Yu Yang, Ti-Rong Wu, Hung Guei +2Evaluation Benchmarks

  9. APPSim-Bench: Bridging Real-world Apps and Reproducible Evaluation for Mobile GUI Agents

    Sep 7, 2026Jintian Feng, Long Chen, Xiao Yu +7Graphical User Interface AgentsDevice

  10. R2S-Eval: Robot Evaluation with Real-to-Sim Calibration via Vision-Language Models

    Sep 3, 2026Yidi Wang, Feixiang Ruan, Ruoqu Chen +4Evaluation BenchmarksSim-To-Real Gap

  11. TRUST: Threshold-Recalibrated Uncertainty-Safe Training for Certified Dismissal in Breast Cancer Screening

    Aug 31, 2026Parham Hajishafiezahramini, Matthew Hamilton, Edward Kendall +2ScreeningDecision Thresholds

  12. Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

    Aug 11, 2026Zhaoyang Wei, Bowen Jiang, Xumeng Han +6Multimodal ReasoningVisual Reasoning

  13. MameLoshnLM: Yiddish Language Model and Evaluation Benchmark

    Aug 6, 2026Uri Katz, Omer Goldman, Tomasz Limisiewicz +2Text CorporaEvaluation Benchmarks

  14. LiveEvalBench: Toward Open-World Evaluation for Web Generation

    Aug 4, 2026Yiyao Wang, Zhen Wen, Yinghao Tang +5Evaluation BenchmarksDiversity

  15. Dynamically Allocating Evaluation Effort for Model Ranking

    Aug 4, 2026Vilém Zouhar, Julia Kreutzer, Alon Lavie +4Model EvaluationEvaluation Benchmarks

  16. MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing

    Aug 3, 2026Zitong Xu, Huiyu Duan, Xinyun Zhang +7Multi-Image Editing BenchmarksImage Editing

  17. RADAR: Rubric-Aware Dependency and Redundancy Analysis for LLM-as-Judge Evaluation

    Aug 3, 2026Divyansh Singh, Reza Davari, Afra MashhadiLlm-As-A-JudgeGrading

  18. Scaling Vision-Language Models Is Not Enough to Mitigate Bias

    Jul 30, 2026Ioannis Sarridis, Ioannis Kompatsiaris, Symeon PapadopoulosBiasesEvaluation Benchmarks

  19. Webly Supervised Multi-Label Recognition: Evaluation Benchmark and Dual-Branch Multi-Label Contrastive Learning

    Jul 23, 2026Zhihua Xu, Zhijing Yang, Yufeng Yang +1Multi-Label ClassificationContrastive Learning

  20. ALLUDE: A Unified Evaluation System for Configurable Attacks in Differentiable Environments

    Jul 19, 2026Mansi Phute, Alexander Greenhalgh, Matthew Hull +8Evaluation BenchmarksDifferentiable Rendering

  21. Real-World Evaluation of an AI Agent Drafting Translational Impact Summaries

    Jul 18, 2026Mohammad Arvan, Amber E. Osterholt, Bailee Rue +5Scholar Information DatabaseArtificial Intelligence Agents

  22. VQCSim: When Does Compile-Once Statevector Simulation Beat Generic Quantum Frameworks?

    Jul 13, 2026Anton Firc, Martin Perešíni, Vojtěch Mrázek +7Variational Quantum CircuitsHybrid Quantum-Classical Pipeline

  23. A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation

    Jul 9, 2026Liuyi Wang, Kai Sheng, Zongtao He +8Vision-Language NavigationVisual Perception

  24. WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

    Jul 7, 2026Wei Dong, Tianyu Fu, Zhe Yu +9Web AgentsEvaluation Benchmarks

  25. MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

    Jul 2, 2026Yuanzhi Liu, Shousheng Zhao, Bo Zhou +2Multimodal BenchmarksEvaluation Benchmarks

  26. Overview of the TalentCLEF 2026: Skill and Job Title Intelligence for Human Capital Management

    Jun 30, 2026Luis Gasco, Hermenegildo Fabregat, Laura García-Sardiña +8JobsSkills

  27. Critical Interval MSE: Toward Reliable Offline Validation for Robot Manipulation Policies

    Jun 29, 2026Haoxu Huang, Tongsam Zheng, Yifan Chen +2Robot PoliciesPolicy Evaluation

  28. Scalable Behavior Cloning with Open Data, Training, and Evaluation

    Jun 25, 2026Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh +15Behavior CloningTeleoperation

  29. Theory-Scale Auto-Formalization of Logics for Computer Science

    Jun 25, 2026Yuming Feng, Frederick Pu, One An +5AutoformalizationFormal Verification

  30. What We are Missing in Multimodal LLM Evaluation?

    Jun 24, 2026Po-han Li, Shenghui Chen, Sandeep Chinchali +1Multimodal Large Language ModelsEvaluation Benchmarks

  31. REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

    Jun 22, 2026Yifei Zhao, Qian Lou, Mengxin ZhengAdversarial EvaluationRed-Teaming

  32. An Extensive Benchmark for Single-round and Multi-round Instruction-based Image Editing

    Jun 14, 2026Yiwei Ma, Ke Ye, Weihuang Lin +4Multi-Image Editing BenchmarksImage Editing

  33. EIBench: A Simulator-Based Benchmark and Turn-Credit RL for Emotion Management

    Jun 14, 2026Rongzhi Zhu, Xiang Huang, Yuchuan Wu +8User SimulationEmotion Recognition

  34. CODA-BENCH: Can Code Agents Handle Data-Intensive Tasks?

    Jun 13, 2026Yuxin Zhang, Ju Fan, Meihao Fan +2Data Science AgentsSynthetic Benchmark

  35. RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation

    Jun 11, 2026Dayu Xia, Yue Shi, Yao Mu +7Robotic ManipulationEvaluation Benchmarks

  36. OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics

    Jun 8, 2026Mingxian Lin, Shengju Qian, Yuqi Liu +9Agentic BenchmarksWebarena Domains

  37. MMAE: A Massive Multitask Audio Editing Benchmark

    Jun 5, 2026Ziyang Ma, Ruiqi Yan, Ruiyang Xu +35Audio EditingEvaluation Benchmarks

  38. MacArena: Benchmarking Computer Use Agents on an Online macOS Environment

    Jun 4, 2026Victor Muryn, Maksym Shamrai, Sofiia Mazepa +1Graphical User InterfaceEvaluation Benchmarks

  39. Enhancing Software Engineering Through Closed-Loop Memory Optimization

    Jun 4, 2026Xuehang Guo, Zora Zhiruo Wang, Qingyun Wang +2Software EngineeringSoftware

  40. Search-Time Contamination in Deep Research Agents: Measuring Performance Inflation in Public Benchmark Evaluation

    Jun 3, 2026Yongjie Wang, Xinyue Zhang, Kunhong Yao +4Agentic BenchmarksEvaluation Benchmarks

  41. What Are We Actually Benchmarking in Robot Manipulation?

    Jun 2, 2026Tianchong Jiang, Xiangshan Tan, Samuel Wheeler +3Robotic ManipulationEvaluation Benchmarks

  42. Beyond Ideal Instruction: A Comprehensive Framework for Evaluating LLMs in Realistic Interactions

    Jun 2, 2026Xuan Yang, Hao Xu, Tingfeng Hui +4Large Language Model EvaluationEvaluation Benchmarks

  43. OmniEEG-Bench: A Standardized Evaluation Benchmark for EEG Foundation Models

    May 30, 2026Ziling Lu, Zongsheng Li, Xinke Shen +11Electroencephalography Foundation ModelsElectroencephalography

  44. Pre-Deployment Robustness Stress Testing for CT Segmentation Systems Using Clinically Motivated Multi-Corruption Augmentation

    May 30, 2026CholMin Kanga, Jonghyun Chung, Amanpreet Kaur +2Multi Organ Computed Tomography SegmentationStress Testing

  45. Selecting New Measurement Locations to Diversify Traffic-Pattern Coverage: A Real-World Evaluation for Total Traffic Volume Estimation

    May 25, 2026Masaaki Inoue, Akifumi Okuno, Shintaro FukushimaAccurate Traffic ForecastingTraffic

  46. AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

    May 23, 2026Jialiang Yang, Bin Xia, Ruihang Chu +6Audio-Video GenerationEvaluation Benchmarks

  47. VLA-REPLICA: A Low-Cost, Reproducible Benchmark for Real-World Evaluation of Vision-Language-Action Models

    May 20, 2026Alex S. Huang, Jiahui Zhang, Shiqing Tang +1Large-Scale Robot Demonstration DatasetsEvaluation Benchmarks

  48. Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges

    May 19, 2026Husnain Amjad, Raja Khurram Shahzad, Aamir Shahzad +1Mathematical ReasoningLLM Reasoning Strategies

  49. Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

    May 17, 2026Chaoqun He, Mingyang Xiang, Yingjing Xu +5Evaluation BenchmarksOmni

  50. Large Language Models Lack Temporal Awareness of Medical Knowledge

    May 13, 2026Zihan Guan, Qiao Jin, Guangzhi Xiong +6Clinical Reasoning TrainingEvaluation Benchmarks