15 papers in the last four weeks, up 200% on the four weeks before. 0.1% of all new papers.
Jul 24, 2026·Yifei Zhao, Xiangxin Zhou, Wenhao Yang +11AI Agent BenchmarksTool-Using Vision-Language Agents
1Tencent Hunyuan · 2THU · 3NJU +3
Jul 17, 2026·Ce Zhang, Ziyang Wang, Yulu Pan +6Temporal Video GroundingTool-Using Vision-Language Agents
University of North Carolina at Chapel Hill · Sony
Jul 16, 2026·Susan Liang, Chao Huang, Filippos Bellos +3Test-Time ScalingTool-Using Vision-Language Agents
University of Rochester · Univeristy of Michigan
Jul 13, 2026·Kaixin Ma, Di Feng, Alexander Metz +3Tool-Use EvaluationTool-Using Vision-Language Agents
Apple
Jul 10, 2026·Xiaofan Wu, Xi Zeng, Miaoxia Chen +5Memory-Augmented VLMsTool-Using Vision-Language Agents
Chance AI
Jul 3, 2026·Animesh Tripathy, Aswanth KrishnanVLM AdaptationTool-Using Vision-Language Agents
QpiAI India Pvt. Ltd.
Jul 3, 2026·Zhenkun Gao, Yicheng Bao, Jinlong Peng +13Multimodal RAGVideo QA
East China Normal University · Tencent Youtu Lab · HFIPS, Chinese Academy of Sciences +3
Jul 1, 2026·Zipeng Guo, Xiaoan Liu, Lichen Ma +9Image Editing EvaluationText-Guided Image Editing
Wuhan University · Xi’an Jiaotong University · Sun Yat-sen University
Jun 30, 2026·Dengxian Gong, Yuanzheng Wu, Haobo Yuan +11Vision-Language GroundingTool-Using Vision-Language Agents
Wuhan University · UC Merced · UTS +3
Jun 30, 2026·Ming Dai, Zhihong Lu, Jinjie Gu +5Tool-Augmented Language Model AgentsAgentic Search
Southeast University · Ant Group
Jun 30, 2026·Binjie Zhang, Mike Zheng ShouReinforcement LearningGroup Relative Policy Optimization
Show Lab, National University of Singapore
Jun 29, 2026·Mingkuan Feng, Jinyang Wu, Hao Gu +5Tool Use in VLMsMultimodal QA
Department of Automation, BNRist, Tsinghua University · Institute of Automation, Chinese Academy of Sciences
Jun 29, 2026·Yutao Sun, Yanting Miao, Hao-Xuan Ma +8Tool Use in VLMsVLM Adaptation
1Qwen Large Model Application Team, Alibaba · 2Zhejiang University · University of Waterloo +3
Jun 26, 2026·ZhengXian Wu, Hangrui Xu, Kai Shi +8Multimodal RAGMultimodal Search Agents
OPPO AI Center, OPPO Inc. China · The Shenzhen International Graduate School, Tsinghua University · Nanyang Technological University, Singapore
Jun 22, 2026·Hengji Zhou, Lingxuan Huang, Jian Wang +4Video Editing BenchmarksLLM Agent Orchestration
1Harbin Institute of Technology, Shenzhen · 2South China University of Technology · 3The University of Hong Kong +1
Jun 18, 2026·Yalun Dai, Hao Li, Shulin Tian +10Visual Spatial Reasoning3D Spatial Reasoning
1NTU · ★Ropedia · 2THU +2
Jun 16, 2026·Sneha Rao, Shaina Raza, Dhanesh RamachandramVLM EvaluationVision-Language Grounding
Vector Institute, Toronto, ON M5G 0C6, Canada
Jun 16, 2026·Haowen Liu, Xirui Li, Shaoxiong Yao +5Long-Horizon Robotic ManipulationVLM Distillation
University of Maryland College Park · University of Illinois Urbana-Champaign · University of Waterloo +3
Jun 15, 2026·Maram Hasan, Aman Verma, Savitra Roy +5Disaster Damage AssessmentRL for Language Model Reasoning
Indian Institute of Technology Bombay · Mohamed bin Zayed University of Artificial Intelligence
Jun 15, 2026·Haoqin Tu, Jianwen Chen, Zijun Wang +14Continual Learning for LLM AgentsAI Agent Benchmarks
1UC Santa Cruz · 2UNC-Chapel Hill · 3Google +1
Jun 13, 2026·Zhengbo Zhang, Changtao Miao, Jinbo Su +10Multimodal IRMultimodal Grounding
School of Artificial Intelligence, UCAS · Institute of Automation, CAS · Ant Digital Technologies, Ant Group +2
Jun 11, 2026·Seokju Cho, Ryo Hachiuma, Abhishek Badki +8Tool Use in VLMs3D Spatial Reasoning
KAIST · NVIDIA
Jun 11, 2026·Yimin Hu, Mengtao Xu, Hao Guo +3LLM Agent Self-ImprovementLLM Agent Skill Learning
Alibaba Group
Jun 11, 2026·Changye Li, Meng Lu, Yi Wu +1Tool Use in VLMsVisual Spatial Reasoning
Tsinghua University · Virginia Tech · NVIDIA
Jun 9, 2026·Yijian Li, Changze Li, Hantian Shi +4Vision-Language NavigationTool-Using Vision-Language Agents
Shanghai Jiao Tong University · Huawei Technologies Ltd.
Jun 6, 2026·Zichen Zhu, Yuheng Sun, Mingxuan Zhu +11Text-Guided Image EditingTool-Using Vision-Language Agents
X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University · Huawei Technologies Ltd. · Shanghai Innovation Institution +1
Jun 5, 2026·Haoyuan Li, Zhengdong Hu, Jun Wang +23D Spatial ReasoningTool-Using Vision-Language Agents
Zhejiang University, Hangzhou, China · University of Technology Sydney, Sydney, Australia · OPPO Research Institute, Shenzhen, China
Jun 5, 2026·Siyi Chen, Hugo Hadfield, Alex Zook +9Long-Horizon Robotic ManipulationTool-Using Vision-Language Agents
1NVIDIA · University of Michigan
Jun 4, 2026·Chenming Zhu, Jingli Lin, Yilin Long +4Visual Spatial ReasoningWorld Model Learning
1The University of Hong Kong · 2Shanghai AI Laboratory · 3Shanghai Jiao Tong University +2
Jun 3, 2026·Deguo Xia, Zihan Li, Haochen Zhao +6HD Map ConstructionAutonomous Driving
Tsinghua University Baidu Beijing, China · University of Macau Macao, China · Institute of Information Engineering, Chinese Academy of Sciences Beijing, China +2