Multimodal Grounding

Momentum

18 papers in the last four weeks, up 200% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 120

All topics
CardsList
  1. TiTok: Audio-Visual LLM for Multi-Segment Temporal Grounding

    Oct 7, 2026Eunji Shin, Dahyun Choi, Seungyeon Jo +2Multimodal GroundingMultimodal Large Language Models

  2. Mutual Equilibrium: Multimodal Representation Learning through Reciprocal Feedback

    Sep 30, 2026Ho-min Park, Byungkon KangMultimodal GroundingMultimodal Embedding

  3. MG-Thinker: Bi-Axial Self-Reflection for Multi-Image Reasoning Grounding

    Sep 29, 2026Heyu Huang, Chi Chen, Zonghao Guo +3Multimodal GroundingMultimodal CoT Reasoning

  4. MoGround: Measuring and Mitigating Modality Distraction in Vision-Language Models

    Sep 27, 2026Luca Zhou, Bo Zhao, Rose Yu +2VLM EvaluationMultimodal Grounding

  5. PhysAlign: A Benchmark for Evidence-Grounded Role Alignment in Multimodal Physics Reasoning

    Sep 27, 2026Kecheng Liang, Haoyang Liu, Zexin Chen +5Multimodal GroundingMultimodal Reasoning

  6. EngIntervene: Benchmarking Multimodal Engineering State Understanding and Design Intervention Reasoning

    Sep 27, 2026Jinchang Zhang, Yingda Tao, Jiakai Lin +1Multimodal GroundingMultimodal Reasoning

  7. Mind What Matters for Reasoning: Aligning Cross-Modal Attention via Selective Probability Mass Concentration

    Sep 24, 2026Jiaqi Deng, Zonghan Wu, Zhan Heng +3Multimodal GroundingMultimodal Large Language Models

  8. OmniFysics-Nano-V2 Technical Report: Understanding the Physical World Across Modalities

    Sep 22, 2026Yizhou Liu, Jinghang Han, Kaixiang Qiu +8Multimodal GroundingPhysical Reasoning

  9. MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning

    Sep 21, 2026Mingke Lu, Anxing Xiao, David HsuMultimodal GroundingRobot Task Planning

  10. Omni2Web: Benchmarking Audiovisual Website Development

    Sep 20, 2026Minghao Han, Zhenghao Xing, Xize Cheng +7Multimodal GroundingAudio-Visual Understanding

  11. AgriScope: Pixel-Grounded Multimodal Understanding for Agricultural Images

    Sep 17, 2026Abderrahmene Boudiaf, Mohamad Alanssari, Irfan Hussain +1Agricultural Image AnalysisMultimodal Grounding

  12. E-AVI: Evidence-Grounded Multimodal Assessment for Automated Video Interviews

    Sep 17, 2026Haoshen Wang, Dongbo Che, Zeyi Xie +3Multimodal GroundingAudio-Visual Understanding

  13. Gaze as Evidence for Common Grounding: A Cross-Corpus Analysis of MapTask and MUNDEX

    Sep 16, 2026Nan Li, Albert Gatt, Massimo PoesioMultimodal Grounding

  14. QuPAINT: Physics-Aware Multimodal Reasoning for Quantum Material Characterization

    Sep 14, 2026Sankalp Pandey, Xuan-Bac Nguyen, Hoang-Quan Nguyen +4Multimodal GroundingSynthetic-to-Real Domain Adaptation

  15. What Did the MLLM Hear? Token-Level Spectro-Temporal Grounding for Audio MLLM Explainability

    Sep 14, 2026Lucia Cascone, Valeria Fraenza, Michele Nappi +2Multimodal GroundingAudio-Language Models

  16. Anchoring Clinical Events in Time: UID-Preserving Multimodal Reconstruction and Source-Grounded Adjudication

    Sep 14, 2026Sayantan Kumar, Nicolas Grimaldi, Jack Cummins +1Multimodal GroundingDocument Information Extraction

  17. Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking

    Sep 11, 2026Parinthapat Pengpun, Simran Khanuja, Graham NeubigMultimodal GroundingVLM Reasoning

  18. Dreaming in Flow: Generative Grounding Feedback for Self-Evolving Unified Multimodal Models

    Sep 8, 2026Ke Hao, Yuanzhi Liang, Tingxi Chen +5Multimodal GroundingUnified Multimodal Models

  19. InSituMeasure: Probing Situated Measurement Grounding in Industrial Scenes with Multimodal Large Language Models

    Sep 3, 2026Chao Shen, Xinyuan Li, Yunfan Zhou +4Multimodal GroundingMultimodal Robustness

  20. ExBind: A Controlled Diagnostic Benchmark for Visual-to-Executable Correspondence

    Sep 1, 2026Ziqian Wang, Yuxiao Cheng, Tingxiong Xiao +1Multimodal GroundingMultimodal Model Evaluation

  21. Perceive to Hypothesize, Verify to Ground: An Agentic Reasoning Framework for Open-World Geo-Localization

    Aug 30, 2026Yutian Jiang, Ruijie Li, Sisuo Lyu +4Multimodal GroundingGeospatial Reasoning

  22. MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

    Aug 11, 2026Changhao Xiang, Shangyu Xing, Zhen Wu +2Multimodal GroundingMultimodal Pretraining

  23. Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

    Aug 11, 2026Zhaoyang Wei, Bowen Jiang, Xumeng Han +6Multimodal GroundingMultimodal Robustness

  24. Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

    Aug 11, 2026Huosen Ou, Dongni Song, Yuncong Wang +2Multimodal Grounding3D Gaussian Splatting

  25. Investigating Multimodal Informativity under Different Partner Visibility Conditions in Video-Mediated Dialogue

    Aug 9, 2026Esam Ghaleb, Hugh Mee Wong, Kristina KobrockMultimodal GroundingMultimodal Fusion

  26. Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation

    Aug 8, 2026Yichun Yeh, Yiheng Li, Xiaobo Hu +2Multimodal GroundingDigital Forensics

  27. Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?

    Aug 6, 2026Yuyang Dai, Xueqing Peng, Yuxia Wang +2Multimodal GroundingLLM Decision-Making

  28. Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

    Aug 5, 2026Yang Yang, Jiawei Chen, Tairan Chen +1Multimodal GroundingVisual Spatial Reasoning

  29. EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

    Aug 5, 2026Xinyuan Guan, Feifan Chen, Xinyu Zhan +3Multimodal GroundingLarge Language Model-Based Robot Planning