Multimodal Grounding

Momentum

18 papers in the last four weeks, up 200% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 122

All topics
CardsList
  1. MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild

    Jun 15, 2026Haotian Qi, Gabriel SkantzeMultimodal GroundingAudio-Visual Understanding

  2. Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning

    Jun 13, 2026Zhengbo Zhang, Changtao Miao, Jinbo Su +10Multimodal IRMultimodal Grounding

  3. Findings of the MAGMaR 2026 Shared Task

    Jun 10, 2026Alexander Martin, Dengjia Zhang, Joel Brogan +7Multimodal RAGMultimodal Grounding

  4. Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

    Jun 9, 2026Miaoxin Cai, Guanqun Wang, Wei Zhang +6Remote Sensing Image UnderstandingMultimodal Grounding

  5. M3^3Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions

    Jun 5, 2026Zhengjun Huang, Wenxuan Liu, Zhoujin Tian +6Multimodal GroundingEfficient Multimodal Inference

  6. FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs

    Jun 2, 2026Eshika Khandelwal, Jingjing Pan, Mingfang Zhang +3Multimodal GroundingVideo Object Detection

  7. The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue

    Jun 1, 2026Sherzod Hakimov, Mattia D'Agostini, Ivan Samodelkin +1VLM EvaluationMultimodal Grounding

  8. Agent Skills Should Go Beyond Text: The Case for Visual Skills

    May 31, 2026Binxiao Xu, Ruichuan An, Bocheng Zou +1Multimodal GroundingAgent Skill Learning

  9. Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

    May 31, 2026Wanlong Fang, Tianle Zhang, Wen Tao +1Multimodal GroundingMultimodal Large Language Models

  10. TIGER: Traceable Inference with Graph-Based Evidence Routing for Mitigating Hallucinations in Multimodal Generation

    May 29, 2026Kaixiang Zhao, Tianrun Yu, Shawn Huang +3Multimodal GroundingMultimodal Generation

  11. Recognizing Co-Speech Gestures in-the-Wild

    May 29, 2026Sindhu B Hegde, K R Prajwal, Andrew ZissermanMultimodal GroundingGesture Recognition

  12. GUI-C2^2: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning

    May 29, 2026Junlong Li, Chao Hao, Lap-Pui Chau +1Multimodal GroundingAgentic RL

  13. Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization

    May 27, 2026Jiawei Kong, Hao Fang, Shunxiang Liao +5Multimodal GroundingDirect Preference Optimization

  14. MinhwaNet: Faithful but Insufficient Object Grounding in Korean Folk Painting

    May 26, 2026Joonhyung BaeMultimodal GroundingMultimodal Classification

  15. AnchorDiff: Training-Free Concept Grounding for MM-DiTs via Anchor-Based Graph Propagation

    May 26, 2026Jian Zhang, Zhijun ZhangMultimodal GroundingMultimodal Diffusion Models

  16. DuoGesture: Motion-Grounded Semantic Conditioning and Biomechanical Beat Priors for Co-Speech Gesture Generation

    May 25, 2026Ferdinand Paar, Lanmiao Liu, Aslı Özyürek +2Multimodal GroundingHuman Motion Generation

  17. GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations

    May 21, 2026Wenxuan Guo, Ziyuan Li, Meng Zhang +7Multimodal GroundingRobotic Manipulation

  18. HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding

    May 19, 2026Mengqi Shi, Haopeng ZhangMultimodal GroundingVideo Summarization

  19. TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval

    May 18, 2026Xinyu Sun, Huangyu Dai, Lingtao Mao +5Multimodal IRMultimodal Grounding

  20. IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning

    May 18, 2026Chenghao Li, Fusheng Hao, Xikai Zhang +5Multimodal GroundingObject Hallucination in VLMs

  21. From Scenes to Elements: Multi-Granularity Evidence Retrieval for Verifiable Multimodal RAG

    May 14, 2026Guanhua Chen, Chuyue Huang, Yutong Yao +4Multimodal RAGMultimodal Grounding

  22. Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

    May 13, 2026Trung Nguyen Quang, Yiming Gao, Fanyi Pu +3Multimodal GroundingMultimodal Large Language Models

  23. Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

    May 13, 2026Qinwu Xu, Yifan Jiang, Haoyu RenMultimodal GroundingCoT Reasoning

  24. ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence

    May 13, 2026Zhuofan Shi, Peilun Jia, Baoqin Sun +4Multimodal RAGMultimodal Grounding

  25. RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

    May 11, 2026Danni Xu, Shaojing Fan, Harry Cheng +1VLM EvaluationMultimodal Grounding