cs.CVOct 1, 2026

SLVR: Structured Latent Visual Reasoning via Human-like Reasoning Flows

Authors: Albert Gao, Bing Xue, Andrea Zanette

Abstract

Multimodal large language models (MLLMs) often answer visual reasoning questions by relying on linguistic priors rather than task-relevant visual evidence. Textual chain-of-thought reasoning can partially mitigate this issue by encouraging models to decompose visual questions into intermediate evidence-seeking steps, but generating these steps autoregressively increases inference cost. Latent reasoning avoids explicit rationale generation, but existing approaches provide limited control over what intermediate states encode, making it difficult to impose separate supervision for planning, grounding, and evidence selection. We propose Structured Latent Visual Reasoning (SLVR), a training framework that bridges explicit chain-of-thought and latent reasoning by organizing multimodal reasoning into typed latent stages for planning, grounding, evidence selection, and reasoning integration. SLVR first trains the model to rely on the image by masking answer-revealing text and contrasting the correct answer with visually plausible distractors. It then organizes reasoning into latent stages for planning, grounding, evidence selection, and integration, supervising each stage with the corresponding signal: plans, boxes, visual evidence, and final rationales. This gives latent reasoning an explicit functional structure while avoiding generated textual chains at inference time. Built on Qwen2.5-VL-7B, SLVR improves consistently across multimodal reasoning benchmarks, with absolute gains of +9.4 on MMVP and +14.2 on BLINK Relation, as well as improvements on V*, MathVista, and ChartQA. These results suggest that structured latent supervision can improve fine-grained visual reasoning without the decoding overhead of textual CoT. Project page is available here.

Explore similar work

CardsList
  1. UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs

    May 12, 2026Houcheng Jiang, Jiajun Fu, Junfeng Fang +4Efficient Multimodal InferenceMultimodal Large Language Models

  2. Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence

    Sep 28, 2026Xi Xiao, Tianchen Zhao, Youngeun Kim +10Large Vision-Language ModelsLatent Visual Reasoning

  3. Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs

    May 4, 2026Xin Zhang, Qiqi Tao, Jiawei Du +2Inference-Time OptimizationTest-Time Optimization