cs.AIOct 7, 2026

DUDA-Bench: Benchmarking LLM Agents on Multimodal Data-Driven Urban Diagnosis

Authors: Yizhi Song, Hang Ni, Weijia Zhang, Hao Liu

Organizations: The Hong Kong University of Science and Technology (Guangzhou) Guangzhou, China

Abstract

Urban diagnosis integrates heterogeneous observations to identify urban problems, localize affected areas, and investigate contributing factors, informing evidence-based urban planning and management. However, its reliance on labor-intensive, case-specific expert workflows limits scalability and reuse, motivating the exploration of agent-based execution. To evaluate this capability, we introduce DUDA-Bench, a hierarchical and interactive benchmark that formalizes data-driven urban diagnosis as a multi-stage agent workflow. It comprises 86 atomic and 22 workflow tasks spanning four analytical stages, grounded in multimodal data from 12 cities covering five urban problem types. Evaluations of seven backbone models and five agent systems reveal a substantial gap between isolated analytical competence and end-to-end diagnosis, with system benefits varying across backbones. Trajectory analysis shows that unresolved evidence gaps propagate across stages, while successful recovery involves revising assumptions and actions using feedback. These findings highlight limitations in coordinating analytical capabilities across stages, particularly adaptive planning, evidence integration, and verification. More broadly, DUDA-Bench provides a framework for translating expert analytical workflows into hierarchical agent tasks and process-aware evaluation, supporting systematic assessment of end-to-end analytical capabilities.

Figures & tables

Appendix figures & tables7 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling

    Jul 15, 2026Xixuan Hao, Yutian Jiang, Jiabo Liu +4Multi-Agent ReasoningUrban Environments