Large-Scale Benchmark

Momentum

9 papers in the last four weeks, up 80% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 77

All topics
CardsList
  1. AerialDojo-200K: A Large-Scale Benchmark Suite for Open-World Aerial Object-Goal Search

    Sep 28, 2026Tongtong Feng, Xin Wang, Haoran Hou +9Aerial Vision-Language NavigationOpen-World

  2. SlopBench: How Well Can We Rank Language Models by Slop? A Multi-Domain Benchmark of Repetitive AI Writing

    Sep 27, 2026Dhruv Roongta, Harsha Gaddipati, Anh Tuan HuynhLanguage Model ComputesText Corpora

  3. RGBD20K: A Large-Scale Benchmark for RGB-D Semantic Segmentation

    Sep 24, 2026Shaohua Dong, Zexuan Meng, Haiyan Sun +6Rgb-Depth CamerasMultimodal Dataset

  4. When Post-Processing Fairness Constraints Help and When They Harm: Evidence from Eight Cross-Domain Evaluations

    Sep 22, 2026Nithin Raghava Ramachandra NarlaFairness AuditsAlgorithmic Fairness

  5. Reliable Virtual Sensing: A Multi-Domain Benchmark for Robustness Under Sensor Failures

    Sep 16, 2026Jens U. Brandt, Noah C. Puetz, Alexander Windmann +4Robot FailuresVision Sensors

  6. SEA-SpeechBench: A Large-Scale Multitask Benchmark for Speech Understanding Across Southeast Asia

    Sep 9, 2026Jingyi Liao, Wenyu Zhang, Zhuohan Liu +6Multilingual BenchmarkThai

  7. DriveMotion: A Large-Scale Multi-Source Benchmark for Driver Motion Sequence Modeling and Forecasting

    Sep 8, 2026Yuhang Wang, Chuheng Wei, Jingxin Yang +2Human Motion PredictionNaturalistic Driving Data

  8. TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue

    Aug 25, 2026Freeman Jiang, Ramon Sanabria, Soham Deshmukh +16Turn-TakingDialogue Benchmarks

  9. HiPHI: A Large-Scale Benchmark for High-Precision Human Motion and Object-Interaction

    Aug 17, 2026Jiahao Ji, Ji Ma, Runhan Zhang +12Training-Set Long-Tail MotionsHuman Motion

  10. CoMedBench: A Multi-Source Benchmark of Synthetic Medical Data Fidelity and Downstream Utility

    Aug 13, 2026Akanta Das, Al Amin Farhad, Mrinmoy Sarkar Anto +3Synthetic DataLarge-Scale Benchmark

  11. NBA_Streaming: A Large-Scale Benchmark for Fine-Grained Basketball Commentary Generation in Continuous Streams

    Aug 10, 2026Lifang Wu, Yuyang Wu, Yangdong Gao +3StreamingLarge-Scale Benchmark

  12. OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction

    Aug 6, 2026Taiting Lu, Runze Liu, Ziwei Dong +18Large-Scale Benchmark3D Reconstruction

  13. OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing

    Aug 5, 2026Taiting Lu, Kaiyuan Lin, Ziwei Dong +18Electronic Design AutomationLarge Language Model Routing

  14. Chem World: A Large-Scale Benchmark and Physics-Informed Framework for Trustworthy Chemical Property Prediction

    Jul 30, 2026Tianyou Bai, Huan Wang, Mingchen Gao +4Molecular Property PredictionLarge-Scale Benchmark

  15. RDVSv2: A Large-scale Benchmark for RGB-D Video Salient Object Detection

    Jul 28, 2026Tianyu Li, Jiahao He, Keren Fu +1Rgb-Thermal Object DetectionRgb-Depth Cameras

  16. Beyond Appearance: A Multi-cue Framework and Large-scale Benchmark for Pedestrian Association and Tracking on Mobile Aerial-Ground Platforms

    Jul 26, 2026Ruiqi Wu, Bingliang Jiao, Ruize Han +6Multi-Object TrackingCross-View Fusion

  17. Poster: Rethinking Security in LLM Code Generation through Real-World Risk Scenarios

    Jul 25, 2026Lixun Ma, Ruolong Ma, Bei Wang +4Large Language Model SafetyVulnerable Code

  18. DishSeg24k: A Large-Scale Benchmark for Food Segmentation with Stochastic Expert Decoding

    Jul 25, 2026Yilin Wang, Haochen Shi, Guanyu Chen +4Large-Scale BenchmarkSilver Bullet

  19. Subject-Level Heterogeneity in EEG Motor Imagery Decoding: A Large-Scale Benchmark and Portfolio-Based Reduction of the Search Space

    Jul 24, 2026Xavier Vasques, Paul Barbaste, Olivier OullierControlled ComparisonLarge-Scale Benchmark

  20. T-STAR: A Large-Scale Benchmark for Spatio-Temporal Panoptic Scene Graph Generation in Satellite Video

    Jul 23, 2026Linlin Wang, Xue Yang, Zhihuang Zhou +3Satellite DataSpatio-Temporal Scene Graphs

  21. HyperImageNet: A Large-Scale High-Spatial Resolution Hyperspectral Imagery Classification Benchmark

    Jul 23, 2026Chuguang Zeng, Jingtao Li, Yinhe Liu +1Hyperspectral ImageLand Cover

  22. Building2Building: A Large Scale Benchmark for Generalizable Real-World Reinforcement Learning

    Jul 17, 2026Vincent Taboga, Justin Veilleux, Doseok Jang +2Hvac ControlReinforcement Learning Control

  23. Who&When Pro: Can LLMs Really Attribute Failures in AI Agents?

    Jul 10, 2026Jiale Liu, Huajun Xi, Shaokun Zhang +6Artificial Intelligence AgentsLarge-Scale Benchmark

  24. Dual-Correlation Hypergraph Network for Unaligned RGBT Video Object Detection and A Large-scale Benchmark

    Jul 9, 2026Qishun Wang, Yapeng Li, Zhengzheng Tu +2Rgb-Thermal Object DetectionRgb-Thermal

  25. WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

    Jul 7, 2026Wei Dong, Tianyu Fu, Zhe Yu +9Web AgentsEvaluation Benchmarks

  26. XPlainVerse: A Million-Scale Benchmark for Explainable Deepfake Detection

    Jul 3, 2026Abhijeet Narang, Kartik Kuckreja, Shreya Ghosh +3Deepfake DetectionLarge-Scale Benchmark

  27. ExpoMotion: A Large-Scale Benchmark and A Householder Projection Network for Multi-Exposure Fusion

    Jul 3, 2026Yao Liu, Lishen Qu, Shihao Zhou +6Visible Image FusionVisual Priors

  28. MORE: A Multilingual Document Parsing Benchmark and Evaluation

    Jul 3, 2026Long Xu, Binghong Wu, Tinghao Yu +6Multilingual BenchmarkMultilingual

  29. S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval

    Jul 2, 2026Xiaodong Wang, Xuanyi Zhao, Pedro Rodriguez +7Episodic MemoryStreaming

  30. LLVM-Bench: Benchmarking and Advancing Large Language Models for LLVM Compiler Issue Resolution

    Jul 1, 2026Zhao Tian, Yingquan Zhao, Chenyao Suo +2Large-Scale Benchmark

  31. Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition

    Jun 30, 2026Zhiyao Shu, Jiacheng Yang, Yang Lu +3Visual Place RecognitionUrban Environments

  32. Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models

    Jun 30, 2026Kaiyun Yang, Ruilin Yang, Zhimin Yao +2Vision-Language Model AdaptationIn-Context Learning

  33. Diagnosing and Mitigating Retrieval Bottlenecks in LLM-Based Cold-Start Recommendation

    Jun 29, 2026Zhe Dong, Fang Qin, Manish Shah +1RerankingCold-Start

  34. Toward Secure and Reliable PDDL Formalization of Large Language Models with Planner-in-the-Loop Feedback

    Jun 29, 2026Jiamei Jiang, Jiajing Zhang, Feifei Mo +2Large Language Model PlanningFormalization

  35. Learning Motion Feasibility from Point Clouds in Cluttered Environments

    Jun 25, 2026Sajid Ansari, Arthi, Girish Varma +1Point CloudsRobotic Perception

  36. A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2

    Jun 17, 2026Yijin Wang, Shuyi Wang, Wenhan Zhang +1Ai-Generated Image DetectionImage Generation

  37. VoxWatermark: A Large-Scale Benchmark for Audio Watermark Detection under Perturbations

    Jun 13, 2026Farnaz Sedaghati, Yuxi Wang, Zicheng Weng +1Multi-Bit WatermarkingWatermarks

  38. ClusBench: The Clustering Benchmark Data Resource You've All Been Waiting For (?)

    Jun 9, 2026David P. HofmeyrClusteringSynthetic Data

  39. SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

    Jun 6, 2026Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi +3SurgeryLarge Language Model Evaluation

  40. Zero-Shot Learning in Industrial Scenarios: New Large-Scale Benchmark, Challenges and Baseline

    Jun 6, 2026Zekai Zhang, Qinghui Chen, Maomao Xiong +6Zero-ShotIndustrial

  41. Unification of Closed-Open Industrial Detection Scenarios: New Large-Scale Benchmarks,Challenges and Baselines

    Jun 6, 2026Zekai Zhang, Jinglin Zhang, Qinghui Chen +8Recent Vision-Language ModelsLarge-Scale Benchmark

  42. PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects

    May 31, 2026Sicheng Yang, Shulan Ruan, Shiwei Wu +4Multilingual Automatic Speech RecognitionDialects

  43. Learning to Assess the Reliability of Number-of-Runs Estimation in Stochastic Optimization

    May 27, 2026Sara Gjorgjieva, Eva Tuba, Tome EftimovStochastic OptimizationLarge-Scale Benchmark

  44. LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?

    May 26, 2026Xiaohan Wang, Mingze Yin, Yilin Zhao +2Computerized Adaptive TestingLarge-Scale Benchmark

  45. Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork

    May 23, 2026Yuheng Jing, Kai Li, Ziwen Zhang +8Single-AgentLarge-Scale Benchmark

  46. AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding

    May 21, 2026Haocheng Li, Juepeng Zheng, Zenghao Yang +5Precision AgricultureGrounding

  47. BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

    May 18, 2026Zhensheng Wang, Wenmian Yang, Qingtai Wu +3Algorithmic TradingLarge Language Model Benchmarks

  48. iMiGUE-3K: A Large-Scale Benchmark for Micro-Gesture Analysis with Self-Supervised Learning

    May 16, 2026Chengyan Wang, Haoyu Chen, Hui Wei +3Hand Gesture RecognitionTraining-Set Long-Tail Motions

  49. Reframing preprocessing selection as model-internal calibration in near-infrared spectroscopy: A large-scale benchmark of operator-adaptive PLS and Ridge models

    May 13, 2026Gregory Beurier, Robin Reiter, Camille Noûs +2Least SquaresInfrared

  50. SpikeProphecy: A Large-Scale Benchmark for Autoregressive Neural Population Forecasting

    May 13, 2026John R. Minnick, Jinghui Geng, Kamran Hussain +6Time-To-First-SpikePopulations

  51. SpecX: A Large-Scale Benchmark for Multi-Modal Spectroscopy and Cross-Paradigm Evaluation

    May 11, 2026Chengrui Xiang, Tengfei Ma, Yujie Chen +3Laser-Induced Breakdown SpectroscopyLarge-Scale Benchmark