Large Multimodal Models

Latest papers 75

All topics
CardsList
  1. Evaluating the Evaluators: Diagnosing Large Multimodal Models for AI-Generated Image Assessment

    Sep 29, 2026Yu Zhao, Jiarui Wang, Huiyu Duan +5Modern Text-To-Image ModelsLarge Multimodal Models

  2. From Text Decisions to Pixels: An Study of Jev-Style Visual Choice Model

    Sep 24, 2026Xunlan Zhou, Xianliang Yang, Li ZhaoKnowledge-Based Visual Question AnsweringPixels

  3. MultiVENT-Raw: A Benchmark for Retrieval and Reasoning over Raw Videos

    Sep 23, 2026Reno Kriz, David Etter, Alexander Martin +11Large Multimodal ModelsRelevance

  4. RegRet: Enhancing Region-Level Retrieval in Large Multimodal Models

    Sep 15, 2026Xun Liang, Honghui Yang, Weihang Pan +6Multimodal RetrievalLarge Multimodal Models

  5. From Symbolic Perception to Logical Deduction: A Framework for Guiding Language Models in Geometric Reasoning

    Sep 9, 2026Weichen Dai, Rafael Medeiros Cabral, Ziyi Shou +4LLM Reasoning StrategiesDeduction

  6. LogiScope-VQA: Benchmarking Vision-Language Models for Logistics Hazard Identification in Industrial Scenarios

    Sep 9, 2026Hanjing Zhou, Mingze Yin, Ying Lian +3TextvqaHazard

  7. CoFiE: Coarse-to-Fine Evidence Selection for Efficient Streaming Video Understanding

    Sep 3, 2026Jing Jiang, Yiran Ling, Ruonan Li +2Streaming Video UnderstandingVision Encoders

  8. Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning

    Aug 17, 2026Ao Shen, Yongheng Zhang, Yinghui Li +3Latent Visual ReasoningLarge Multimodal Models

  9. Visual Distortion Detection in UGC Images Using Large Multimodal Models

    Aug 10, 2026Ziheng Jia, Yingji Liang, Jiaying Qian +1Synthetic Image DetectionDistortion

  10. LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents

    Aug 7, 2026Ivan Majic, Zexian Huang, Franziska Hübl +5Large Multimodal ModelsSpatial Reasoning

  11. ReGraph: Learning to Generate Recipe Graphs from Food Images

    Aug 7, 2026Guoshan Liu, Bin Zhu, Pengkun Jiao +3RecipeGraph Representation Learning

  12. See2Think: Do Multimodal Models Really Use Intermediate Visual States?

    Jul 29, 2026Siyu Yan, Zhuoran Yan, Haiying Xu +10Large Multimodal ModelsMultimodal Model

  13. Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis

    Jul 11, 2026Shihao Yuan, Yuanze Li, Ruyi Zhang +2Large Multimodal ModelsModalities

  14. Empowering Long-form Omni-modal Understanding with Robust Audio Perception

    Jul 11, 2026Kaiying Yan, Luoyi Sun, Xiao Zhou +1Audio-Visual ReasoningOmni-Modal

  15. DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

    Jul 9, 2026Pengjie Wang, Linger Deng, Zujia Zhang +6Large Multimodal ModelsMultimodal Reasoning

  16. Large Multimodal Model-Based Environment-Aware Mobility Management

    Jul 9, 2026Seokhyun Jeong, Sangmok Shin, Seungnyun Kim +2MobilityLarge Multimodal Models

  17. Infinity-Parser2 Technical Report

    Jul 8, 2026Zuming Huang, Jun Huang, Kexuan Ren +12Document ParsingMultimodal Documents

  18. Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis

    Jul 6, 2026Zhipeng Xu, Zulong Chen, Qing Liu +6Information ExtractionLarge Multimodal Models

  19. Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models

    Jul 3, 2026Hulingxiao He, Zhi Tan, Yuxin PengLarge Multimodal ModelsTaxonomy

  20. Learning from Reliable Latent Prompts for Visual Recognition with Missing Modalities

    Jun 29, 2026Taixi Chen, Nancy GuoMultimodal LearningMissing Modalities

  21. Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

    Jun 25, 2026Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar +5Multimodal GenerationLarge Multimodal Models

  22. Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models

    Jun 25, 2026Shravan Venkatraman, Ritesh Thawkar, Omkar Thawakar +4Recent Vision-Language ModelsLarge Multimodal Models

  23. HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

    Jun 25, 2026Jiajun Wu, Haoyu Kang, Yining Sun +13Long-Video BenchmarksLarge Multimodal Models

  24. Latent Visual States for Efficient Multimodal Reasoning

    Jun 23, 2026Xiuwei Chen, Wentao Hu, Yongxin Wang +8Latent Visual ReasoningLarge Multimodal Models

  25. An LMM for Precisely Grounding Elements in Documents

    Jun 23, 2026Yijian Lu, Chuangxin Zhao, Kai Sun +3Large Multimodal ModelsGrounding

  26. AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model

    Jun 17, 2026Diogo Glória-Silva, João Cardeira, Manuel Letras da Luz +8Vision-Language AlignmentLarge Multimodal Models

  27. InterleaveThinker: Reinforcing Agentic Interleaved Generation

    Jun 11, 2026Dian Zheng, Harry Lee, Manyuan Zhang +4Multi-Reference Image GenerationImage Generation

  28. GRIP: Feedback-Guided Prompt Retrieval for Large Multimodal Models

    Jun 10, 2026Garvita Allabadi, Matteo Sodano, Roberto Estevão +4Large Multimodal ModelsIn-Context Learning

  29. MultiToP: Learning to Patch Visual Tokens to Mitigate Hallucinations in Video Large Multimodal Models

    Jun 10, 2026Yuansheng Gao, Wenbin Xing, Jiahao Yuan +4Video Multimodal Large Language ModelsLong Visual-Token Sequences

  30. ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations

    Jun 9, 2026Junke Wang, Xiao Wang, Jiacheng Pan +16Autoregressive Image GenerationLarge Multimodal Models

  31. GeoMetric: Injecting Metric Geographic Structure into Worldwide Image Geo-Localization

    Jun 8, 2026Junchao Cui, Xuanzi Ma, Wenqi Shi +3Cross-View Geo-LocalizationGeogs-Slam

  32. FlowNar: Scalable Streaming Narration for Long-Form Videos

    May 30, 2026Zeyun Zhong, Manuel Martin, Chengzhi Wu +4Streaming Video UnderstandingLarge Multimodal Models

  33. LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?

    May 26, 2026Xiaohan Wang, Mingze Yin, Yilin Zhao +2Computerized Adaptive TestingLarge-Scale Benchmark

  34. Advancing Creative Physical Intelligence in Large Multimodal Models

    May 25, 2026Cheng Qian, Hyeonjeong Ha, Jiayu Liu +10Large Multimodal ModelsCreativity

  35. VersusQ: Pairwise Margin Reasoning for Generalizable Video Quality Assessment

    May 20, 2026Shibei Meng, Binxin Yang, Yuan Liu +4Video QualityFine-Grained Video Understanding

  36. ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

    May 19, 2026Zuhao Yang, Kaichen Zhang, Sudong Wang +7Video AgentMultimodal Agents

  37. LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue

    May 19, 2026Chaoyue Li, Yongxue Xu, Jie Feng +1Spatio-Temporal ReasoningLarge Multimodal Models

  38. RAVE: Re-Allocating Visual Attention in Large Multimodal Models

    May 18, 2026Xi Leng, Xinhong Ma, Ziqiang Dong +4Cross-Modal AttentionLarge Multimodal Models

  39. Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models

    May 15, 2026Yujun Tong, Dongliang Chang, Zijin Yin +3Multimodal GenerationLarge Multimodal Models

  40. GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language

    May 13, 2026Jinwoong Kim, Rui Yang, Huishuai ZhangHuman-Annotated BenchmarkGeogs-Slam

  41. GeoR-Bench: Evaluating Geoscience Visual Reasoning

    May 12, 2026Yushuo Zheng, Zicheng Zhang, Huiyu Duan +7Geospatial ReasoningMultimodal Reasoning Benchmarks

  42. Personal Visual Context Learning in Large Multimodal Models

    May 11, 2026Zihui Xue, Ami Baid, Sangho Kim +2Large Multimodal ModelsVisual In-Context Learning

  43. GeoSym127K: Scalable Symbolically-verifiable Synthesis for Multimodal Geometric Reasoning

    May 10, 2026Jinhao Jing, Zheng Ma, Jinwei Liang +9Large Multimodal ModelsNeuro-Symbolic Framework

  44. Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs

    May 10, 2026Jiafeng Liang, Zhihao Zhu, Zihan Zhang +7Large Multimodal ModelsVisual Evidence

  45. LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation

    May 8, 2026Jun Wang, Fengpeng Li, Hang Dong +2Lithology ClassificationGeological Semantic Understanding

  46. VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding

    May 7, 2026Kuanwei Lin, Wenhao Zhang, Ge LiVideo CompressionLarge Multimodal Models

  47. VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing

    May 5, 2026Andong Deng, Dawei Du, Zhenfang Chen +7Video EditingLarge Multimodal Models

  48. Referring Multiple Regions with Large Multimodal Models via Contextual Latent Steering

    May 3, 2026Yun Xing, Hanyuan Liu, Jiahao Nie +1Large Multimodal ModelsRegion

  49. Talking Slide Avatars: Open-Source Multimodal Communication Approach for Teaching

    Apr 26, 2026Xinxing WuAvatarsTalk