Webarena Domains

Momentum

8 papers in the last four weeks, with none the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 40

All topics
CardsList
  1. Auditing Web Agent Evaluation on WebArena-Lite: Human Review of Outcomes and Trajectories

    Oct 1, 2026Chengguang Gan, Zimeng He, Yoshihiro Tsujii +3Web AgentsAgentic Evaluations

  2. SymbolicArena: A Unified Infrastructure for Benchmark Distillation and Dynamic Evaluation in Symbolic Regression

    Sep 28, 2026Ziwen Zhang, Xiju Wu, Yuheng Jing +9Symbolic RegressionSynthetic Benchmark

  3. Before Acting, Change the State: Prospective State Intervention for Web Agents under Deceptive Interfaces

    Sep 28, 2026Ruozhao Yang, Mingfei Cheng, Xiaofei XieWeb AgentsAgentic Deployments

  4. Does Learning to Predict the World Help Agents Act? Auditing World-Model Post-Training

    Sep 27, 2026Xinyu Che, Hang Yan, Yanchen Liu +5Next-State PredictionWorld Models

  5. PFArena: Benchmarking Language Models for Protein Modification

    Sep 24, 2026Yawen Ouyang, Xinbo Zhang, Ziyuan Ma +15ProteinQuality-Driven Selective Mutation

  6. ActiveArena: Benchmarking and Understanding Active Perception in Robotic Manipulation

    Sep 21, 2026Yibo Li, Enshen Zhou, Rui Chen +7Viewpoint-Dependent Active PerceptionRobotic Manipulation

  7. BabelArena: A Large-Scale Multilingual Benchmark for LLM Agents

    Sep 20, 2026Peng Kuang, Yuchun Fan, Jiangnan Li +7Multilingual AgentsMultilingual Benchmark

  8. 360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents

    Aug 9, 2026Kenta Watanabe, Atsuyuki Miyai, Mizuki Takenawa +2Urban EnvironmentsObject Goal Navigation

  9. Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

    Aug 9, 2026Yijun Pan, Yukun Lian, Kunyu Shi +5Large Language Model AgentsWebarena Domains

  10. Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents

    Aug 6, 2026Jiaming Wei, Zekun Wu, Adriano Koshiyama +1Web AgentsStrategic Agents

  11. Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Capabilities

    Aug 4, 2026William Bolton, Philip TorrScientific IdeationArtificial Intelligence Benchmarks

  12. Beyond IID: How General Are Tabular Foundation Models, Really?

    Jun 29, 2026Lennart Purucker, Andrej Tschalzev, Nick Erickson +7Tabular Foundation ModelsBenchmark Datasets

  13. Computer Vision for MOBA Analytics: A Dataset and Baseline for Visibility Analysis in Dota 2

    Jun 25, 2026Ricardo da Rocha Carvalho, Eloísa Oliveira, Luiz Bernardo Martins Kummer +2VisibilityMotion-Based Perception

  14. SidConArena: An Environment Evaluating Agents in Open-Ended,Positive-Sum Bargaining Game

    Jun 24, 2026Yeqi Feng, Yuxin Chen, Tianxing HeNegotiationChatbot Arena

  15. A Differentiable Atari VCS:A Complex, Fully Known Ground Truth for Explainable AI

    Jun 21, 2026Andreas Maier, Siming Bayer, Patrick KraussExplainable Artificial IntelligenceXai

  16. Embedded Arena: Iterative Optimization via Hardware Feedback

    Jun 15, 2026Zhihan Zhang, Alexander Le Metzger, Jiuyang Lyu +10Wearable DevicesWebarena Domains

  17. Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

    Jun 12, 2026Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz +4Token Budget AllocationSkills

  18. Speculative Rollback Correction for Quality-Diverse Web Agent Imitation

    Jun 10, 2026Longkun Hao, Hongyu Lin, Hao Li +10Imitation LearningAutoregressive Rollout

  19. OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics

    Jun 8, 2026Mingxian Lin, Shengju Qian, Yuqi Liu +9Agentic BenchmarksWebarena Domains

  20. CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences

    May 30, 2026Fangzhou Lin, Peiran Li, Lingyu Xu +12Computer VisionVideo Editing

  21. Physical Atari: A Robust and Accessible Platform for Real-time Reinforcement Learning on Robots

    May 29, 2026Khurram Javed, Joseph Modayil, Gloria Kennickell +2Scalable Robot LearningRobot Systems

  22. WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction

    May 28, 2026Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu +14Multimodal MemoryMultimodal Agents

  23. DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

    May 27, 2026Jiamian Wang, Ruiyi Zhang, Tong Yu +5Multimodal DocumentsSearch Agents

  24. Review Arcade: On the Human Alignment and Gameability of LLM Reviews

    May 27, 2026Hans Ole Hatzel, Sebastian Steindl, Jan StrichPeer ReviewReviewer

  25. When to Switch, Not Just What: Transition Quality Prediction in Clash Royale

    May 21, 2026Heeyun Heo, Huy Kang KimSwitchTransitions

  26. An Executable Benchmarking Suite for Tool-Using Agents

    May 10, 2026Zhiqing Zhong, Zhijing Ye, Jiamin Wang +1Swe-Bench VerifiedWebarena Domains

  27. Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models

    May 7, 2026Zhikai Li, Yue Zhao, Edward Zhongwei Zhang +4Diffusion-Based Reinforcement Learning MethodsDiffusion Models

  28. TCD-Arena: Assessing Robustness of Time Series Causal Discovery Methods Against Assumption Violations

    May 4, 2026Gideon Stein, Niklas Penzel, Tristan Piater +1Causal Discovery MethodsAssumptions

  29. DRIVE: Modeling Skills at the Reasoning and Interaction Levels for Web Agents under Continual Learning

    Apr 28, 2026Xirui Liu, Sihang Zhou, Yanning Hou +6Web AgentsInteraction Data

  30. WorldMark: A Unified Benchmark Suite for Interactive Video World Models

    Apr 23, 2026Xiaojie Xu, Zhengyuan Lin, Kang He +5Video World ModelsWorld Models

  31. ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning

    Feb 25, 2026Xiaoxuan Wang, Han Zhang, Haixin Wang +11Agentic Reinforcement LearningWebarena Domains

  32. DR-Arena: an Automated Evaluation Framework for Deep Research Agents

    Jan 15, 2026Yiwen Gao, Ruochen Zhao, Yang Deng +1Deep ResearchEvaluation Agent

  33. PPTArena: A Benchmark for PowerPoint Editing

    Dec 2, 2025Michael Ofengenden, Yunze Man, Ziqi Pang +2Precise EditingWebarena Domains

  34. BuildArena: A Physics-Aligned Interactive Benchmark of LLMs for Engineering Construction

    Oct 18, 2025Tian Xia, Tianrun Gao, Wenhao Deng +4ConstructionWebarena Domains