cs.LGSep 23, 2026

VCMM: Variance-Calibrated Momentum for Multimodal Learning

Authors: Zhongjing Gu, Chenyang Huang, Yufa Feng, Chong He, Qinxu Ding, Yiming Cui

Abstract

Multimodal joint training often suffers from modality imbalance, where a dominant modality suppresses the optimization of others. Existing methods mainly balance modality learning by modulating gradient magnitudes or directions, modifying optimization objectives, or adjusting training strategies, with most interventions focusing on the current update. However, when combined with widely used momentum-based optimizers, the update also incorporates accumulated information from previous gradients, which is not explicitly addressed by current-step modulation alone. To address this issue, we propose Variance-Calibrated MomentuM (VCMM), which adapts gradient memory to modality-specific gradient dynamics. Specifically, VCMM estimates minibatch noise and temporal drift online and uses their relative strength to determine modality-specific momentum through a Kalman-inspired controller. We further center the control signal across modalities and apply exact bias correction for the time-varying first moment, enabling adaptive gradient memory without extra network passes or explicit learning-rate scaling. Experiments on four multimodal benchmarks demonstrate consistent improvements with modest training overhead.

Figures & tables

Explore similar work

CardsList
  1. Balancing Multimodal Learning through Label Space Reshaping

    May 22, 2026Xiaoyu Ma, Weijie Zhang, Yuanhao Gao +3Multimodal LearningCross-Modal

  2. CAT-GS: Balanced Multimodal Learning via Calibrated Gating and Fusion Surgery

    Date pendingMahir Shahriar Tamim, Sharjil Khan, Md. Samiul Alim +3Multimodal LearningGating