Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. SketchVLM: Vision language models can annotate images to explain thoughts and guide users

    Apr 23, 2026Brandon Collins, Logan Bolton, Hung Huy Nguyen +3Vision-Language ModelsLLM-Assisted Annotation

  2. ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

    Apr 23, 2026Jingpei Wu, Xiao Han, Weixiang Shen +3Process Reward ModelsMultimodal QA

  3. Source-Modality Monitoring in Vision-Language Models

    Apr 23, 2026Etha Tianze Hua, Tian Yun, Ellie PavlickVision-Language ModelsMultimodal Understanding

  4. Context Unrolling in Omni Models

    Apr 23, 2026Ceyuan Yang, Zhijie Lin, Yang Zhao +16Cross-Modal LearningUnified Multimodal Models

  5. Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts

    Apr 23, 2026Azher Ahmed Efat, Seok Hwan Song, Wallapak TavanapongData VisualizationMultimodal Large Language Models

  6. Latent Denoising Improves Visual Alignment in Large Multimodal Models

    Apr 23, 2026Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan +1VLM RobustnessMultimodal Large Language Models

  7. MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment

    Apr 23, 2026Juan Li, Chuanghao Ding, Xujie Zhang +1Cross-Modal LearningCross-Modal Alignment

  8. Can MLLMs "Read" What is Missing?

    Apr 23, 2026Jindi Guo, Chaozheng Huang, Xi FangVLM EvaluationDocument Understanding

  9. Using Machine Mental Imagery for Representing Common Ground in Situated Dialogue

    Apr 22, 2026Biswesh Mohapatra, Giovanni Duca, Laurent Romary +1Multimodal GroundingConversational Agents

  10. V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Multimodal ReasoningReinforcement Learning with Verifiable Rewards

  11. Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Vision-Language ModelsHallucination in Language Models

  12. ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards

    Apr 22, 2026Wentao Yan, Shengqin Wang, Huichi Zhou +4Multimodal IRProcess Reward Models

  13. Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

    Apr 21, 2026Jing Jin, Hao Liu, Yan Bai +9Reasoning EvaluationMultimodal Reasoning

  14. A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

    Apr 21, 2026Shuai Wang, Hongyi Zhu, Jia-Hong Huang +6Multimodal RAGMultimodal Grounding

  15. Bridging Traditional Explainability Methods and Multimodal Multilingual Models: An XAI-Based Analysis

    Apr 21, 2026Paweł Pozorski, Jakub Muszyński, Maria GanzhaMultimodal Large Language ModelsNeural Network Interpretability

  16. How Far Are Video Models from True Multimodal Reasoning?

    Apr 21, 2026Xiaotian Zhang, Jianhui Wei, Yuan Wang +9Multimodal ReasoningVideo Reasoning

  17. Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale

    Apr 20, 2026A. Sophia Koepke, Daniil Zverev, Shiry Ginosar +1Cross-Modal LearningCross-Modal Representation Learning

  18. Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions

    Apr 20, 2026Kecheng Zhang, Zongxin Yang, Mingfei Han +6Streaming Video UnderstandingEfficient VLM Inference

  19. Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs

    Apr 20, 2026Samuel G. Balter, Ethan Jerzak, Connor T. JerzakMultimodal Large Language ModelsMultimodal Reasoning

  20. SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning

    Apr 19, 2026Yian Li, Yang Jiao, Bin Zhu +4Visual Spatial ReasoningUnified Multimodal Models

  21. E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition

    Apr 19, 2026Meng Zhang, Jinzhong Ning, Xiaolong Wu +2Multimodal GroundingNamed Entity Recognition

  22. Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models

    Apr 18, 2026Xinru Yan, Boxi Cao, Yaojie Lu +4Unified Multimodal ModelsNeural Network Interpretability

  23. AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

    Apr 17, 2026Edson Araujo, Saurabhchand Bhati, M. Jehanzeb Mirza +5Cross-Modal LearningAudio-Visual Understanding

  24. Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

    Apr 17, 2026Habibeh Naderi, Behrouz Haji Soleimani, Stan MatwinCross-Modal LearningModality Imbalance

  25. Real-Time Visual Attribution Streaming in Thinking Model

    Apr 17, 2026Seil Kang, Woojung Han, Junhyeok Kim +3VLM InterpretabilityMultimodal Reasoning

  26. Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems

    Apr 16, 2026Nishanth Madhusudhan, Vikas Yadav, Alexandre LacosteMultimodal QAMultimodal Reasoning