Multimodal Grounding

Momentum

18 papers in the last four weeks, up 200% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 120

All topics
CardsList
  1. Findings of the MAGMaR 2026 Shared Task

    Jun 10, 2026Alexander Martin, Dengjia Zhang, Joel Brogan +7Multimodal RAGMultimodal Grounding

  2. Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

    Jun 9, 2026Miaoxin Cai, Guanqun Wang, Wei Zhang +6Remote Sensing Image UnderstandingMultimodal Grounding

  3. M3^3Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions

    Jun 5, 2026Zhengjun Huang, Wenxuan Liu, Zhoujin Tian +6Multimodal GroundingEfficient Multimodal Inference

  4. FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs

    Jun 2, 2026Eshika Khandelwal, Jingjing Pan, Mingfang Zhang +3Multimodal GroundingVideo Object Detection

  5. The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue

    Jun 1, 2026Sherzod Hakimov, Mattia D'Agostini, Ivan Samodelkin +1VLM EvaluationMultimodal Grounding

  6. Agent Skills Should Go Beyond Text: The Case for Visual Skills

    May 31, 2026Binxiao Xu, Ruichuan An, Bocheng Zou +1Multimodal GroundingAgent Skill Learning

  7. Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

    May 31, 2026Wanlong Fang, Tianle Zhang, Wen Tao +1Multimodal GroundingMultimodal Large Language Models

  8. TIGER: Traceable Inference with Graph-Based Evidence Routing for Mitigating Hallucinations in Multimodal Generation

    May 29, 2026Kaixiang Zhao, Tianrun Yu, Shawn Huang +3Multimodal GroundingMultimodal Generation

  9. Recognizing Co-Speech Gestures in-the-Wild

    May 29, 2026Sindhu B Hegde, K R Prajwal, Andrew ZissermanMultimodal GroundingGesture Recognition

  10. GUI-C2^2: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning

    May 29, 2026Junlong Li, Chao Hao, Lap-Pui Chau +1Multimodal GroundingAgentic RL

  11. Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization

    May 27, 2026Jiawei Kong, Hao Fang, Shunxiang Liao +5Multimodal GroundingDirect Preference Optimization

  12. MinhwaNet: Faithful but Insufficient Object Grounding in Korean Folk Painting

    May 26, 2026Joonhyung BaeMultimodal GroundingMultimodal Classification

  13. AnchorDiff: Training-Free Concept Grounding for MM-DiTs via Anchor-Based Graph Propagation

    May 26, 2026Jian Zhang, Zhijun ZhangMultimodal GroundingMultimodal Diffusion Models

  14. DuoGesture: Motion-Grounded Semantic Conditioning and Biomechanical Beat Priors for Co-Speech Gesture Generation

    May 25, 2026Ferdinand Paar, Lanmiao Liu, Aslı Özyürek +2Multimodal GroundingHuman Motion Generation

  15. GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations

    May 21, 2026Wenxuan Guo, Ziyuan Li, Meng Zhang +7Multimodal GroundingRobotic Manipulation

  16. HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding

    May 19, 2026Mengqi Shi, Haopeng ZhangMultimodal GroundingVideo Summarization

  17. TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval

    May 18, 2026Xinyu Sun, Huangyu Dai, Lingtao Mao +5Multimodal IRMultimodal Grounding

  18. IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning

    May 18, 2026Chenghao Li, Fusheng Hao, Xikai Zhang +5Multimodal GroundingObject Hallucination in VLMs

  19. From Scenes to Elements: Multi-Granularity Evidence Retrieval for Verifiable Multimodal RAG

    May 14, 2026Guanhua Chen, Chuyue Huang, Yutong Yao +4Multimodal RAGMultimodal Grounding

  20. Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs

    May 13, 2026Trung Nguyen Quang, Yiming Gao, Fanyi Pu +3Multimodal GroundingMultimodal Large Language Models

  21. Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

    May 13, 2026Qinwu Xu, Yifan Jiang, Haoyu RenMultimodal GroundingCoT Reasoning

  22. ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence

    May 13, 2026Zhuofan Shi, Peilun Jia, Baoqin Sun +4Multimodal RAGMultimodal Grounding

  23. RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

    May 11, 2026Danni Xu, Shaojing Fan, Harry Cheng +1VLM EvaluationMultimodal Grounding

  24. Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization

    May 11, 2026Yeongtak Oh, Dongwook Lee, Sangkwon Park +2Multimodal GroundingMultimodal Large Language Models

  25. SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

    May 10, 2026Kun Xiang, Terry Jingchen Zhang, Zirong Liu +15Cross-Modal LearningMultimodal Grounding