Multimodal Model

Momentum

22 papers in the last four weeks, up 267% on the four weeks before. 0.2% of all new papers.

Jul 13Week of Sep 28

Latest papers 133

All topics
CardsList
  1. Gestalt: Large Multimodal Interplay Model

    Sep 30, 2026Zequn Yang, Yu Miao, Haotian Ni +8Multimodal ModelMultimodal Diffusion Models

  2. UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement

    Sep 30, 2026Fang Wu, Da Xing, Yanjie Huang +16Multimodal ModelSelf-Evolution

  3. Beyond Layers: Position-Resolved Gradient Conflict and Position-Aware Modulation for Unified Multimodal Models

    Sep 29, 2026Shuyang Jiang, Fucheng Deng, Yuchuan Luo +1Multimodal ModelAutoregressive Image Generation

  4. Reliability Testing of Medical Model Performance under Distributed Deployment

    Sep 29, 2026Yifei Wang, Xiaohan Zhang, Youtao Ding +4Model EvaluationPre-Deployment Safety Assessments

  5. Mutually Adversarial Self-Training with Evolving Data for Unified Multimodal Models

    Sep 28, 2026Wentao Zhou, Weijie Gan, Jiayun WangMultimodal ModelAdversarial Training

  6. Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning

    Sep 28, 2026Yijia Fan, Ziqi Huang, Zhongang Cai +5Multimodal ModelRenderer

  7. SegBanana: Steering Unified Multimodal Models into Medical Segmenters

    Sep 28, 2026Xiaoye Liang, Ye Yan, Mingze Yin +5Semi-Supervised Medical Image SegmentationMultimodal Model

  8. PhysFieldBench: Can Multimodal Models Understand Physical Fields?

    Sep 28, 2026Yuezhou Ma, Huikun Weng, Jialong Wu +5Multimodal Large Language ModelsMultimodal Model

  9. ARCH-B: Architectural Representation, Comprehension and Hierarchy Benchmark

    Sep 28, 2026Kieran Sagar Parikh, Jose Luis Garcia del Castillo y LopezMultimodal BenchmarksBuilding Information Modeling

  10. SkinAgent AI: A Safety-Grounded Multimodal Agentic Framework for Non-Diagnostic Skincare Support

    Sep 24, 2026Muhammad Muhtasim Shahriar, Abdullah Mohammad Sayem, Tze Hui Liew +2Agentic FrameworkMultimodal Agents

  11. Virtual Encoders in Multimodal Transformers

    Sep 22, 2026Katsuya Ogata, Yuta NakashimaDetection TransformerVision Encoders

  12. Grounded Product Understanding in Livestream Videos

    Sep 17, 2026Xinyu Zhang, Junjie Chen, Jiawei Ge +4Streaming VideoMultimodal Model

  13. From Models to Systems: A Comprehensive Survey of Efficient Multimodal Learning

    Sep 16, 2026Pan Wang, Siwei Song, Hui Ji +12Multimodal LearningMultimodal Model

  14. RegRet: Enhancing Region-Level Retrieval in Large Multimodal Models

    Sep 15, 2026Xun Liang, Honghui Yang, Weihang Pan +6Multimodal RetrievalLarge Multimodal Models

  15. Physics as the label for measuring and correcting materials reasoning in multimodal models

    Sep 14, 2026Hasan Kurban, Rasul Khanbayov, Mustafa KurbanMaterialsPhysics-Aware Models

  16. One Model, Two Physical Stories: Auditing Misalignment in Multi-Modal World Modeling

    Sep 13, 2026Geigh Zollicoffer, Minh Vu, Rajiv Ranasinghe +1Cross-Modal ConflictsMultimodal Model

  17. Dreaming in Flow: Generative Grounding Feedback for Self-Evolving Unified Multimodal Models

    Sep 8, 2026Ke Hao, Yuanzhi Liang, Tingxi Chen +5Multimodal GenerationMultimodal Model

  18. Where Should Language Sit in a Multimodal Model? Lessons from What Language Does to Human Perception and Cognition

    Sep 7, 2026Peng Xie, Amr AlanwarLanguage ModelingMultimodal Model

  19. Whose record is this? Diagnosing and authorizing record use in personalized multimodal models

    Sep 7, 2026Xinyu Mao, Junsi Li, Chenyang Liu +2Reference-Guided Multimodal In-Context VerificationWitnesses

  20. SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

    Aug 31, 2026Zheyu Huang, Zijing Shi, Haozhe Luo +4Social ReasoningReasoning Benchmark

  21. GUIDE: Guiding Internal Evidence with Language Instructions

    Aug 31, 2026Soyeon Caren Han, Hyunsuk Chung, Jinwoo Kim +2Multimodal ModelGuidance

  22. Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models

    Aug 12, 2026Hao Zhang, Jiaxin Qi, Zhijiang Tang +1Multimodal ModelVisual Generation

  23. Multimodal Model Diffing for Feature Discovery and Control

    Aug 10, 2026Hunar Batra, Lachin Naghashyar, Ashkan Khakzar +4Multimodal Large Language ModelsMultimodal Model

  24. ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

    Aug 5, 2026Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun +5Image GenerationMultimodal Generation

  25. Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency

    Aug 3, 2026Hakan Emre Gedik, Shashank Gupta, Alan BovikImage Quality AssessmentSaliency

  26. Talked Out of the Truth: Sycophancy in the Reasoning Chains of Multimodal Models

    Jul 30, 2026Mahir Numayeer Islam, Gakuto Okuyama, Nikolaus Siauw +3SycophancyReasoning Chain

  27. See2Think: Do Multimodal Models Really Use Intermediate Visual States?

    Jul 29, 2026Siyu Yan, Zhuoran Yan, Haiying Xu +10Large Multimodal ModelsMultimodal Model

  28. Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering

    Jul 29, 2026Yu Wang, Sharon LiMultimodal ModelRepresentational Collapse

  29. DynaBridge: Dynamic Summary-Guided Cross-Task Multimodal Fusion for DASS-Structured Mental Health Assessment

    Jul 28, 2026Shiyu Teng, Haichen Yu, Jiaqing Liu +6Multimodal Clinical DataMental Health

  30. MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving

    Jul 27, 2026Junchen Huo, Wanming Hao, Song Wang +3Autonomous Driving PerceptionMulti-Sensor Fusion

  31. Do Visual Features Improve Other-Initiated Repair Detection? A Dyadic Multimodal Approach

    Jul 26, 2026Anh Ngo, Nicolas Rollet, Catherine Pelachaud +1Multimodal ModelNonverbal Cues

  32. Attention from Above: A Multimodal Model for Drone-Based Object Localization

    Jul 20, 2026Hyun-Ki JungDrone DetectionYolo26

  33. OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment

    Jul 20, 2026Wenxiao Fan, Hang Yin, Kan LiSpatial SupervisionSpatial Reasoning

  34. STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs

    Jul 19, 2026Ye Wang, Hongjun Wang, Hao Fang +7Multimodal ModelBridging Language

  35. WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding

    Jul 17, 2026Zonglin Yang, Wei-Zhen Liang, Nevin Lawrence +4Precision AgricultureMultimodal Large Language Models

  36. Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control

    Jul 15, 2026J. M. A. Marcelo, M. Brienza, E. Bugli +4Full-Body Humanoid ControlWhole-Body

  37. Towards Spatial Supersensing in the Wild

    Jul 15, 2026Tianjun Gu, Tianyu Xin, Kuan Zhang +12Multimodal Model

  38. Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning

    Jul 10, 2026Wenxi Gao, Guanxi Lu, Didi Zhu +5Multimodal ReasoningVisual Generation

  39. Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

    Jul 9, 2026Matteo Santelmo, Xiuying Wei, Israa Fakih +5Artificial Intelligence BenchmarksArtificial Intelligence Models

  40. Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

    Jul 7, 2026Andrei-George Durdun, Victor Constantinescu, Radu Tudor IonescuMultimodal Sentiment AnalysisSpeech Translation

  41. Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards

    Jul 6, 2026Tianhao Niu, Ziyu Han, Qiguang Chen +5Visual AnalyticsMultimodal Model

  42. UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation

    Jun 30, 2026Jiahang Tu, Fengyu Yang, Chenyang Ma +8TactileMultimodal Model

  43. Learning to Deny: Action Denial in Multimodal Large Language Models

    Jun 30, 2026Raiyaan Abdullah, Shehreen Azad, Yogesh Singh RawatVideo Multimodal Large Language ModelsMultimodal Large Language Models

  44. Traffic-CBM: A Structurally Interpretable Multimodal Framework for Encrypted Traffic Classification

    Jun 29, 2026Honglei Jin, Wenshuo Chen, Shaofeng Liang +6Network TrafficMultimodal Model

  45. GPTNT: Benchmarking Real-Time Collaboration Between Multimodal Agents on Keep Talking And Nobody Explodes

    Jun 26, 2026Amit Parekh, Sabrina McCallum, Kareem Al-Hasan +3CollaborationMultimodal Agents

  46. Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation

    Jun 25, 2026Jinyu Liu, Xincheng Shuai, Henghui Ding +1Multimodal ModelSynergy

  47. UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation

    Jun 23, 2026Jiahao Lyu, Pei Fu, Zhenhang Li +6Unpaired Image-To-Image TranslationImage-Text Alignment

  48. Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving

    Jun 22, 2026Zisheng Chen, Yuping Qiu, Jianhua Han +6Autonomous DrivingAutonomous Hard Drive Disassembly