Multimodal Grounding

Momentum

18 papers in the last four weeks, up 200% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 120

All topics
CardsList
  1. Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception

    Aug 2, 2026Xinheng Han, Jianfei Wang, Yu Chen +4Multimodal GroundingGroup Relative Policy Optimization

  2. LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

    Jul 30, 2026Enjun Du, Hange Zhou, Chenxu Du +4Multimodal GroundingMultimodal QA

  3. CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

    Jul 28, 2026Lai Wei, Chengqi Li, Jiapeng Li +3Multimodal GroundingMultimodal ICL

  4. Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

    Jul 27, 2026Tianyi Gao, Han Fang, Tianyi Ding +9Multimodal GroundingMultimodal Large Language Models

  5. Enhancing Explainable Cardiac Diagnosis with Guide-Grounded Multimodal LLMs

    Jul 23, 2026Hai-Nam Duy Vuong, Duy-Anh Bui, Trong-Nghia Nguyen +5Multimodal GroundingMedical Report Generation

  6. Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

    Jul 17, 2026Like Liu, Zhengzheng Xu, Haitao He +3Multimodal GroundingAerial Robotics

  7. Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

    Jul 16, 2026Harikrishnan P M, Goutham Vignesh, Ganesh Parab +4Multimodal GroundingEfficient Multimodal Inference

  8. Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

    Jul 15, 2026Zhixiao Zheng, Zheren Fu, Zhiyuan Yao +3Multimodal GroundingMultimodal Large Language Models

  9. UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

    Jul 9, 2026Haibin Tian, Huichao Xie, Xuelin Qian +3Multimodal GroundingMultimodal Model Evaluation

  10. GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

    Jul 8, 2026Kartik Bali, Mahish K. Guru, Christian J Cyron +1Multimodal GroundingMultimodal Large Language Models

  11. A Multimodal Reasoning Typology for Grounding Chart-Image Coherence in Science Communication

    Jul 6, 2026Avina Nakarmi, Sohom Sen, Xun Song +2Multimodal GroundingScientific Communication

  12. PhenoNEST: A Neuro-Symbolic Framework for Ontology-Aware Multimodal Plant Phenotyping and Trait Discovery

    Jul 3, 2026Jayant Ghadge, Soumyashree Kar, Surya S. DurbhaMultimodal GroundingKG Construction

  13. Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails

    Jul 2, 2026Qianyu Chen, Canran Xiao, Runxuan TangMultimodal GroundingMultimodal Foundation Models

  14. Spatial Reasoning via Modality Switching Between Language and Symbolic Representations

    Jun 30, 2026Shreya Rajpal, Tanawan Premsri, Parisa KordjamshidiMultimodal GroundingMultimodal Reasoning

  15. COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models

    Jun 27, 2026Ziqi Zhou, Weize Quan, Mining Tan +6Multimodal GroundingUnified Multimodal Models

  16. Evaluation Pitfalls and Challenges in Multimedia Event Extraction

    Jun 25, 2026Philipp Seeberger, Steffen Freisinger, Tobias Bocklet +1Multimodal GroundingMultimodal Model Evaluation

  17. Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray

    Jun 24, 2026Yonathan Michael, Mohamad Alansari, Natnael Takele +2Multimodal GroundingMultimodal Reasoning

  18. Unlocking Spatial Grounding in Large Audio-Visual Retrieval models

    Jun 22, 2026Hugo Malard, Michel Olvera, Sanjeel Parekh +3Multimodal GroundingAudio-Visual Understanding

  19. SciLens: Multi-modal Scientific Claim Verification with Agentic Entailment and Grounding

    Jun 18, 2026Yueming Wang, Tianshi Zheng, Jiaxin Bai +3Multimodal GroundingAI for Science

  20. ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

    Jun 18, 2026Yihao Wang, Zijian He, Jie Ren +1Multimodal GroundingMultimodal Reasoning

  21. Context-Aware RL for Agentic and Multimodal LLMs

    Jun 15, 2026Peiyang Xu, Bangzheng Li, Sijia Liu +4Multimodal GroundingContrastive RL

  22. Connecting Speech to Words through Images

    Jun 15, 2026Gabriel Pirlogeanu, Dan Oneata, Horia Cucu +1Multimodal GroundingUnsupervised Learning

  23. MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild

    Jun 15, 2026Haotian Qi, Gabriel SkantzeMultimodal GroundingAudio-Visual Understanding

  24. Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning

    Jun 13, 2026Zhengbo Zhang, Changtao Miao, Jinbo Su +10Multimodal IRMultimodal Grounding