Benchmark Saturation

Momentum

11 papers in the last four weeks, up 267% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 57

All topics
CardsList
  1. cua-speedrun: Standardized Benchmarking of the Speed of Computer-Use Agents

    Sep 30, 2026Pranjal Aggarwal, Lawrence Keunho Jang, Sean Welleck +3Computer-Use AgentsBenchmark Saturation

  2. Budget Boundary Effects in Test-Time Mathematical Reasoning

    Sep 30, 2026Guilin Zhang, Ziqi Tan, Wulan Guo +5Mathematical ReasoningTest Time

  3. PowerMarketJax: A JAX Benchmark Suite for Multi-Agent Reinforcement Learning in Power Markets

    Sep 29, 2026Zhanhua Pan, Xin Qin, Xiao Liu +3Multi-Agent Reinforcement LearningDistributed Energy Resources

  4. MetaBench-Harness: Unlocking End-to-End Optimization of Benchmark Harnesses

    Sep 27, 2026Xuanjun Chen, Hua-Hsuan Chen, Wei-Chung Lu +3Benchmark SaturationEvolutionary Optimization Methods

  5. A Living Benchmark for Information Retrieval from Electronic Health Records

    Sep 24, 2026Jordan L. Cahoon, Chloe O. Stanwyck, Sulaiman Somani +23Electronic Health RecordsClinician Trust

  6. VLA-ULAP: Interleaving Cloud VLA Calls with Ultra-Lightweight Local Action Prediction at the Edge

    Sep 16, 2026Deyu Cao, Ryuji Oi, Kosuke Matsushima +4Action PredictionRemote

  7. One Color Preprocessing Improves DSATUR

    Sep 15, 2026Adam Nouira, Lucas IsenmannMaximum Independent SetConvex Relaxation

  8. The Neverwhere Visual Parkour Benchmark Suite

    Sep 14, 2026Ziyu Chen, Henghui Bao, Haoran Chang +12Waymo Open Motion DatasetBenchmark Saturation

  9. Protocol effects on feature-based hardware-Trojan detection across Trust-Hub families

    Sep 7, 2026Hang Xiao, Chuhong Xu, Kainan Zhou +2MalwareGating

  10. The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

    Aug 11, 2026Jeremy Spence, Nicholas Assaderaghi, Feng Xiao +9Security EvaluationReverse Engineering

  11. Don't `Well, Actually' Me Unless You Know What You're Talking About: Weak Presupposition Verification Degrades General QA Performance

    Aug 6, 2026Shenran Wang, Vered Shwartz, Hila GonenQuestion-Answer PairsAssumptions

  12. Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction

    Aug 3, 2026Priyashree Roy, Sujitha Martin, Mohammad Rostami +6Confidence EstimationExtraction

  13. Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

    Jul 27, 2026Tianyi Gao, Han Fang, Tianyi Ding +9Multimodal ReasoningMultimodal Large Language Models

  14. ParasGB: A Graph Benchmark Suite for Parasitic Estimation on AMS Circuits

    Jul 25, 2026Jiajun Zou, Jiawei Liu, Ao Liu +8Printed Circuit BoardCircuits

  15. Robust Feasible Route Construction through Collaborative Partition Optimization

    Jul 4, 2026Oguzhan Karaahmetoglu, Hyong KimVehicle Routing ProblemPrompt Optimization

  16. Life After Benchmark Saturation: A Case Study of CORE-Bench

    Jun 23, 2026Nitya Nadgir, Sayash Kapoor, Kangheng Liu +11Agentic BenchmarksBenchmark Saturation

  17. How Well Do Self-Supervised Speech Models Encode Age and Gender in Children's Speech? A Layer-Wise Analysis Across Multiple Architectures

    Jun 20, 2026Abhijit Sinha, Hemant Kumar Kathania, Mohit Joshi +3Self-Supervised Speech ModelsWav2Vec

  18. ComplexConstraints and Beyond: Expert Rubrics for RLVR

    Jun 8, 2026Sushant Mehta, Liudas Panavas, Suhaas Garre +1Rubric-Based ScoringInstruction-Tuned Models

  19. How Much Capacity Does EEG Denoising Need? Ultra-Compact Networks reveal Benchmark Saturation and Metric-Utility Gap

    Jun 7, 2026Jasmeet Singh Bindra, Siddharth PanwarElectroencephalographyBrain-Computer Interface

  20. Benchmark Everything Everywhere All at Once

    Jun 4, 2026Shiyun Xiong, Dongming Wu, Peiwen Sun +5Agentic BenchmarksLarge Language Model Benchmarks

  21. CodegenBench: Can LLMs Write Efficient Code Across Architectures?

    Jun 1, 2026Jie Li, Wenzhao Wu, Junqi Hu +5Code OptimizationCode Generation

  22. NumLeak: Public Numeric Benchmarks as Latent Labels in Foundation Models

    May 28, 2026Anany KotawalaLeakageBenchmark Saturation

  23. SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents

    May 27, 2026Yubin Qu, Yi Liu, Gelei Deng +4Coding AgentsSynthetic Environments

  24. Constraint acquisition needs better benchmarks

    May 25, 2026Rafał Stachowiak, Tomasz P. PawlakBenchmark SaturationContinuum

  25. The Open Source Economic Index of AI Adoption and Capability

    May 23, 2026Seamus Somerstep, Aritra Guha, Divesh Srivastava +1Artificial Intelligence SystemsBenchmark Saturation

  26. Multi-Fidelity Learning with Shallow Recurrent Decoders for Reactor Physics

    May 22, 2026Stefano Riva, Carolina Introini, J. Nathan Kutz +1Multi-FidelityNuclear Data

  27. CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean

    May 17, 2026Wentao Long, Yunfei Zhang, Chenyi Li +3Theorem ProvingMathematical Reasoning Benchmarks

  28. GPF-LiveNews: A Streaming Evaluation Protocol for Group-Conditioned Framing in Large Language Models

    May 16, 2026Mohd Ariful Haque, Fahad Rahman, Kishor Datta Gupta +1Large Language Model BiasLarge Language Model Evaluation

  29. Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs

    May 8, 2026Andrea Sassella, Andrea Chizzola, Tommaso Bianchi +2Large Language Model BenchmarksItalian Texts

  30. iTRIALSPACE: Programmable Virtual Lesion Trials for Controlled Evaluation of Lung CT Models

    May 7, 2026Fakrul Islam Tushar, Umme Hafsa Momy, Joseph Y. Lo +1Lung-Nodule Artificial IntelligenceCone-Beam Computed Tomography

  31. Who Defines "Best"? Towards Interactive, User-Defined Evaluation of LLM Leaderboards

    Apr 23, 2026Minji Jung, Minjae Lee, Yejin Kim +2LeaderboardChatbot Arena

  32. Beyond Static Benchmarks: Synthesizing Harmful Content via Persona-based Simulation for Robust Evaluation

    Apr 18, 2026Huije Lee, Jisu Shin, Hoyun Song +2Ai-Generated Content DetectionHarmful Content

  33. When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

    Feb 18, 2026Mubashara Akhtar, Anka Reuel, Prajna Soni +34Artificial Intelligence BenchmarksLarge Language Model Benchmarks

  34. WebArxiv: A Reproducible Benchmark for Evaluating Multimodal Web Agents on arXiv Tasks

    Jul 1, 2025Zihao Sun, Zijing Shi, Ling ChenWeb AgentsMultimodal Agents

  35. Code Benchmarks Should Prioritize Rigor, Reliability, and Reproducibility

    Jan 18, 2025Jialun Cao, Yuk-Kit Chan, Zixuan Ling +12Code QualityBenchmark Saturation

  36. Measuring Browser Webcam Gaze Honestly: A Capture-Clock Methodology and Open Reference Implementation

    Date pendingChi-Sheng Chen, Gabriel A. BratGaze BehaviorCamera