Multimodal Understanding

Momentum

10 papers in the last four weeks, up 233% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 413

All topics
CardsList
  1. Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs

    Apr 16, 2026Ziyang Luo, Nian Liu, Junwei HanMultimodal Large Language ModelsMultimodal Reasoning

  2. Confidence under Visual Token Pruning: Removed Evidence and Risk-Controlled Token Budgets for MLLMs

    Apr 13, 2026Kaizhen Tan, Yang Feng, Heqing Du +3VLM EvaluationConfidence Estimation in Language Models

  3. Unified Multimodal Uncertain Inference

    Apr 9, 2026Dengjia Zhang, Alexander Martin, William Jurayj +3Probability CalibrationMultimodal Reasoning

  4. MG2^2-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation

    Apr 4, 2026Sijun Dai, Qiang Huang, Xiaoxing You +1Cross-Modal LearningMultimodal RAG

  5. BUZZY: Contrastive Scoring to Mitigate Text-Induced Bias in Multimodal Multiple-Choice QA

    Mar 30, 2026Taeyun Roh, Suhyeong Park, Dongyoung Lee +4Vision-Language ModelsMultimodal QA

  6. UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy

    Mar 25, 2026Yicheng Xu, Jiangning Zhang, Zhucun Xue +5Multimodal ICLUnified Multimodal Models

  7. UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation

    Mar 23, 2026Ziyi Wang, Xinshun Wang, Shuang Chen +2Cross-Modal LearningUnified Multimodal Models

  8. HumanOmni-Speaker: Identifying Who said What and When

    Mar 23, 2026Detao Bai, Zhiheng Ma, Xihan WeiAudio-Visual UnderstandingVisual Speaker Recognition

  9. ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models

    Mar 19, 2026Thomas De Min, Subhankar Roy, Stéphane Lathuilière +2Multimodal Large Language ModelsAI Agent Benchmarks

  10. HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

    Mar 19, 2026Dan Ben-Ami, Gabriele Serussi, Kobi Cohen +1Multimodal Large Language ModelsMultimodal QA

  11. Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

    Mar 6, 2026Lijiang Li, Zuwei Long, Yunhang Shen +6Masked Diffusion ModelsUnified Multimodal Models

  12. Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks

    Mar 4, 2026Haoyu Liu, Dingcheng Li, Lukas Rutishauser +1Adversarial TrainingMultimodal Robustness

  13. Feature-level Interaction Explanations in Multimodal Transformers

    Mar 4, 2026Yeji Kim, Housam Khalifa Bashier Babiker, Mi-Young Kim +1Transformer InterpretabilityFeature Attribution

  14. SOTAlign: Semi-Supervised Alignment of Unimodal Vision and Language Models via Optimal Transport

    Feb 26, 2026Simon Roschmann, Paul Krzakala, Sonia Mazelet +2Cross-Modal LearningMultimodal Embedding

  15. OmniGAIA: Towards Native Omni-Modal AI Agents

    Feb 26, 2026Xiaoxi Li, Wenxiang Jiao, Jiarui Jin +10Multimodal ReasoningAI Agent Benchmarks

  16. LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models

    Feb 15, 2026Shufan Li, Yuchen Zhu, Jiuxiang Gu +6Unified Multimodal ModelsMultimodal Reasoning

  17. UReason: Benchmarking Reasoning-to-Generation Alignment in Unified Multimodal Models

    Feb 9, 2026Cheng Yang, Chufan Shi, Bo Shui +7Unified Multimodal ModelsImage Generation

  18. Quantifying the Gap between Understanding and Generation within Unified Multimodal Models

    Feb 2, 2026Chenlong Wang, Yuhang Chen, Zhihan Hu +4Unified Multimodal ModelsCross-Modal Alignment

  19. DeALOG: Decentralized Multi-Agents Log-Mediated Reasoning Framework

    Feb 1, 2026Abhijit Chakraborty, Ashish Raj Shekhar, Shiven Agarwal +1Multi-Agent CollaborationMultimodal QA

  20. Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

    Jan 31, 2026Zicheng Kong, Dehua Ma, Zhenbo Xu +9Reward ModelingRL for Language Models

  21. TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs

    Jan 30, 2026Baiqi Li, Kangyi Zhao, Ce Zhang +3VLM EvaluationVideo Understanding

  22. SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

    Jan 29, 2026Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum +2Audio-Language Model EvaluationMultimodal Grounding

  23. AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking

    Jan 25, 2026Xilin Jiang, Qiaolin Wang, Junkai Wu +30Audio-Visual UnderstandingMultimodal Large Language Models

  24. Social Caption: Evaluating Social Understanding in Multimodal Models

    Jan 21, 2026Leena Mathur, Bhaavanaa Thumu, Youssouf Kebe +1Multimodal Large Language ModelsMultimodal Reasoning

  25. CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation

    Jan 12, 2026Chaoyu Li, Fei Tao, Pooyan FazliTest-Time Scaling for VLMsTest-Time Scaling

  26. NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

    Jan 3, 2026Hyeonjeong Ha, Jinjin Ge, Bo Feng +2VLM EvaluationVideo Understanding

  27. VLM2GeoVec: Toward Universal Multimodal Embeddings for Remote Sensing

    Dec 12, 2025Emanuel Sánchez Aimar, Gulnaz Zhambulova, Fahad Shahbaz Khan +2Cross-Modal LearningMultimodal Embedding

  28. VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

    Nov 25, 2025Tianxiang Jiang, Sheng Xia, Yicheng Xu +5VLM EvaluationMultimodal Large Language Models

  29. SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

    Nov 10, 2025Hunar Batra, Haoqin Tu, Hardy Chen +3Visual Question AnsweringScene Graph Generation

  30. M4FC: a Multimodal, Multilingual, Multicultural, Multitask Real-World Fact-Checking Dataset

    Oct 27, 2025Jiahui Geng, Jonathan Tonglet, Iryna GurevychAutomated Fact-CheckingMultimodal Understanding

  31. From Charts to Code: A Hierarchical Benchmark for Multimodal Models

    Oct 20, 2025Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu +8Data VisualizationCode Generation

  32. Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models

    Sep 26, 2025Jiawei Liang, Jianjie Huang, Ruoyu Chen +4Feature AttributionMultimodal Large Language Models

  33. Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

    Sep 22, 2025Geewook Kim, Minjoon SeoVLM EvaluationAudio-Visual Understanding

  34. Reconstruction Alignment Improves Unified Multimodal Models

    Sep 8, 2025Ji Xie, Trevor Darrell, Luke Zettlemoyer +1Unified Multimodal ModelsCross-Modal Alignment

  35. Inverse-LLaVA: Rethinking Multimodal Alignment via Text-to-Vision Mapping

    Aug 17, 2025Xuhui Zhan, Tyler DerrCross-Modal LearningCross-Modal Representation Learning

  36. Position: Reasoning After Perception Means Reasoning Without Vision

    Jul 21, 2025Hongcheng Gao, Zihao Huang, Jingyi Tang +12Visual ReasoningVLM Reasoning

  37. LaViDa: A Large Diffusion Language Model for Multimodal Understanding

    May 22, 2025Shufan Li, Konstantinos Kallidromitis, Hritik Bansal +7Vision-Language ModelsEfficient VLM Inference

  38. HumaniBench: A Human-Centric Framework for Large Multimodal Models Evaluation

    May 16, 2025Shaina Raza, Aravind Narayanan, Vahid Reza Khazaie +6Algorithmic FairnessMultimodal Large Language Models

  39. ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models

    Feb 13, 2025Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma +31Visual ReasoningVLM Reasoning

  40. MultiViewDx: Evidence-Linked Multi-View Clinical Diagnosis

    Oct 19, 2024Junda Wang, Zonghai Yao, Yujan Ting +5HealthcareMedical Image Analysis

  41. MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models

    Date pendingSangyun Chung, Se Yeon Kim, Youngchae Chee +1Multimodal RobustnessHallucination in Language Models

  42. V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval

    Date pendingDongyang Chen, Chaoyang Wang, Dezhao Su +6Multimodal IRMultimodal Grounding

  43. Learning to Think Like a Cartoon Captionist: Incongruity-Resolution Supervision for Multimodal Humor Understanding

    Date pendingHatice Merve Vural, Doga Kukul, Ege Erdem Ozlu +4VLM ReasoningMultimodal CoT Reasoning

  44. Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs

    Date pendingGuiqiu Liao, Matjaz Jogan, Daniel A. HashimotoImage TokenizationHealthcare

  45. CAT-GS: Balanced Multimodal Learning via Calibrated Gating and Fusion Surgery

    Date pendingMahir Shahriar Tamim, Sharjil Khan, Md. Samiul Alim +3Cross-Modal LearningModality Imbalance

  46. Do Multimodal LLMs See Before They Read? Diagnosing Contextual Sycophancy

    Date pendingYi-Cheng Lai, Hen-Hsen HuangLLM SycophancyEvidence-Grounded Reasoning

  47. Video2Reaction: Training Foundation Video Models to Predict Audience Reaction

    Date pendingSidong Zhang, Trang Nguyen, Shiv Shankar +4VLM AdaptationVideo-Language Models