cs.CVSep 29, 2026

OmniRoute: Mapping Temporal Semantic Evidence to Audio-Visual Token Budgets for Efficient Omnimodal Large Language Models

Authors: Yuchen Deng, Zidang Cai, Feidiao Yang, Yufei Wang, Jie Wang, Hai-Tao Zheng, Yuxing Han

Organizations: Shenzhen International Graduate School, Tsinghua University, China · Pengcheng Laboratory, China

Abstract

Omnimodal large language models (Omni-LLMs) encode audio and visual streams into temporally interleaved token sequences for multimodal reasoning. However, processing long audio-visual token sequences incurs substantial prefill costs. Existing compression methods have made progress, but often overlook temporal changes in audio-visual semantic relevance. Motivated by temporal variation and local continuity, we propose OmniRoute, a training-free, two-stage compression framework. First, Temporal Evidence-Guided Budgeting (TEGB) derives chunk-wise modality preferences and initial leading-modality budgets from semantic relevance and local content variation. Second, Budget-Constrained Semantic Compression (BCSC) compresses the leading modality and then calibrates the follower's retention target using the actual retained fraction. For video, it combines spatiotemporal grouping with query-guided selection; for audio, it selects tokens based on encoder attention and query relevance, then merges residual tokens into context anchors under visual guidance. Experiments on four representative benchmarks demonstrate a better trade-off between inference efficiency and performance than competitive baselines. The code and interface will be released to facilitate further research.

Figures & tables

Explore similar work

CardsList
  1. OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

    Jul 25, 2026Jinsen Su, Yongdong Luo, Yuexiao Ma +3Token CompressionOmni-Modal

  2. OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

    Jul 3, 2026Shijie Cao, Qingyu Zhang, Boxi Yu +6Token CompressionAudio-Visual Reasoning

  3. OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

    May 12, 2026Yuchen Deng, Zidang Cai, Hai-Tao Zheng +3Token CompressionAudio-Visual Reasoning