Modalities

Momentum

33 papers in the last four weeks, up 154% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 217

All topics
CardsList
  1. Beyond Symmetric Alignment: Spectral Diagnostics of Modality Imbalance in Vision-Language Models in the Medical Domain

    Jun 3, 2026Alessandro Gambetti, Qiwei Han, Cláudia Soares +1Medical Vision-Language ModelsVision-Language Alignment

  2. An Empirical Study of Data Scale, Model Complexity, and Input Modalities in Visual Generalization

    Jun 3, 2026Yidi ZhouluoStructural ComplexityModalities

  3. scTranslation: A Comprehensive Benchmark for Single-Cell Multi-Omics Modality Translation

    Jun 2, 2026Jiabei Cheng, Jingbo Zhou, Jun Xia +4Modalities

  4. Visual Instruction Tuning Aligns Modalities through Abstraction

    Jun 2, 2026Luis Palacios, Lorenzo Basile, Diego Doimo +1Multimodal Continual Instruction TuningInstruction Tuning

  5. Any2Poster: Any-Source Poster Generation Across Modalities and Domains

    Jun 1, 2026Amogh Vinaykumar, Aiden Li, Suozhi Huang +1PaperpilotModalities

  6. Before Fusion, Ask What to Keep: Contextual Calibration of Multimodal Signals

    Jun 1, 2026Jiyuan Liu, Liangwei Nathan Zheng, Wei Emma Zhang +2Multimodal FusionMultimodal Representations

  7. Boosting Multimodal Federated Learning via Chained Modality Optimization

    Jun 1, 2026Zixin Zhang, Fan Qi, Shuai Li +2FedavgModalities

  8. Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

    May 31, 2026Wanlong Fang, Tianle Zhang, Wen Tao +1Multimodal Large Language ModelsModalities

  9. Wavelet-Fusion Diffusion Model for Multimodal Brain MRI Synthesis with Modality and Metadata Conditioning

    May 30, 2026Muhammad Nabi Yasinzai, Remika Mito, Mangor PedersenMedical Image GenerationMultimodal Diffusion Models

  10. Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models

    May 29, 2026Zijie Zhou, Dandan Zhu, Hangxiangpan Wang +3Recent Vision-Language ModelsCross-Modal

  11. AMix-2: Establishing Protein as a Native Modality in Large Language Models

    May 29, 2026Keyue Qiu, Yixin Wu, Lihao Wang +19ProteinLanguage Modeling

  12. LoMo: Local Modality Substitution for Deeper Vision-Language Fusion

    May 28, 2026Feng Han, Zhixiong Zhang, Zheming Liang +2Recent Vision-Language ModelsMultimodal Benchmarks

  13. Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

    May 25, 2026Bonan Ding, Umair Nawaz, Ufaq Khan +5Fine-Grained Video UnderstandingCross-Modal Attention

  14. Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models

    May 24, 2026Muhammad Ashad Kabir, Sirajam MuniraLarge Audio Language ModelsAcoustic

  15. Balancing Multimodal Learning through Label Space Reshaping

    May 22, 2026Xiaoyu Ma, Weijie Zhang, Yuanhao Gao +3Multimodal LearningCross-Modal

  16. Tackling Multimodal Learning Challenges with Mixture-of-Expert: A Survey

    May 22, 2026Liangwei Nathan Zheng, Wei Emma Zhang, Olaf Maennel +2Multimodal LearningMixture-Of-Experts

  17. Learning Emergent Modular Representations in Multi-modality Medical Vision Foundation Models

    May 21, 2026Yuting He, Chenyu You, Shuo LiModalitiesSelf-Supervised Learning

  18. Multimodal LLMs under Pairwise Modalities

    May 20, 2026Yan Li, Yunlong Deng, Yuewen Sun +3Multimodal Large Language ModelsModalities

  19. MetaEarth-MM: Unified Multimodal Remote Sensing Image Generation with Scene-centered Joint Modeling

    May 19, 2026Zhiping Yu, Chenyang Liu, Jinqi Cao +4Remote SensingTrustworthy Earth Observation Decisions

  20. Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models

    May 19, 2026Yi Zhong, Haotong Qin, Xindong Zhang +2Cross-ModalModalities

  21. Benchmarking transferability of SSL pretraining to same and different modality segmentation tasks

    May 18, 2026Jue Jiang, Harini VeeraraghavanSwinAmodal Segmentation

  22. Modality vs. Morphology: A Framework for Time Series Classification for Biological Signals

    May 18, 2026Jordan Tschida, Matthew Yohe, Edward Kane +10Physiological SignalsTime-Series Classification

  23. TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval

    May 18, 2026Xinyu Sun, Huangyu Dai, Lingtao Mao +5Multimodal RetrievalImage-Text Pairs

  24. SynGR: Unleashing the Potential of Cross-Modal Synergy for Generative Recommendation

    May 18, 2026Wei Chen, Xingyu Guo, Shuang Li +6Multimodal Recommendation ModelCross-Modal

  25. WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform

    May 18, 2026Yu Shang, Yinzhou Tang, Yiding Ma +22Embodied Artificial IntelligenceWorld Models

  26. Beyond Transcripts: Iterative Peer-Editing with Audio Unlocks High-Quality Human Summaries of Conversational Speech

    May 17, 2026Kaavya Chaparala, Thomas Thebaud, Jesús Villalba López +3TranscriptSummarization

  27. Medical Context Distorts Decisions in Clinical Vision Language Models

    May 17, 2026David Restrepo, Ira Ktena, Maria Vakalopoulou +2Medical Vision-Language ModelsMultimodal Clinical Data

  28. MuteBench: Modality Unavailability Tolerance Evaluation for Incomplete Multimodal Fusion

    May 13, 2026Wugeng Zheng, Ziwen Kan, Tianlong Chen +2Missing ModalitiesMultimodal Fusion

  29. Towards Robotic Dexterous Hand Intelligence: A Survey

    May 13, 2026Weiguang Zhao, Tian Liang, Xihao Guo +3Robotic HandsForce

  30. WD-FQDet: Multispectral Detection Transformer via Wavelet Decomposition and Frequency-aware Query Learning

    May 13, 2026Chunjin Yang, Xiwei Zhang, Yiming Xiao +1Infrared Small Target DetectionFeature Pyramid

  31. PRA-PoE: Robust Multimodal Alzheimer's Diagnosis with Arbitrary Missing Modalities

    May 13, 2026Guangqian Yang, Ye Du, Wenlong Hou +2Missing ModalitiesMultimodal Learning

  32. BrainAnytime: Anatomy-Aware Cross-Modal Pretraining for Brain Image Analysis with Arbitrary Modality Availability

    May 13, 2026Guangqian Yang, Tong Ding, Wenlong Hou +4Multimodal NeuroimagingMultimodal Pretraining

  33. SMA: Submodular Modality Aligner For Data Efficient Multimodal Learning

    May 13, 2026Truong Pham, Anay Majee, Rishabh IyerMultimodal AlignmentModality Alignment

  34. Cross-Modal-Domain Generalization Through Semantically Aligned Discrete Representations

    May 12, 2026Souptik Sen, Raneen Younis, Zahra AhmadiCross-Modal AlignmentCross-Modal

  35. Resilient Vision-Tabular Multimodal Learning under Modality Missingness

    May 12, 2026Camillo Maria Caruso, Valerio Guarrasi, Paolo SodaMissing ModalitiesMultimodal Learning

  36. CMKL: Modality-Aware Continual Learning for Evolving Biomedical Knowledge Graphs

    May 11, 2026Yousef A. Radwan, Yao Li, Qing Qing +5Knowledge Graph EmbeddingsBiomedical Knowledge Graph

  37. Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent

    May 10, 2026Yihong Tang, Kehai Chen, Xuefeng Bai +1Multimodal AgentsModalities

  38. From pre-training to downstream performance: Does domain-specific pre-training make sense?

    May 9, 2026Felix KronesMultimodal PretrainingPretraining

  39. Encoder-Decoder Transformers: Logical Characterizations and Periodicity

    May 8, 2026Veeti Ahvonen, Damian Heiman, Antti Kuusisto +2Transformer EncoderTransformer Architectures

  40. PRIMED: Adaptive Modality Suppression for Referring Audio-Visual Segmentation via Biased Competition

    May 8, 2026Yuchen He, Jing ZhangVideo Object SegmentationModality-Specific Encoders

  41. Data Language Models: A New Foundation Model Class for Tabular Data

    May 7, 2026Eda Erol, Giuliano Pezzoli, Ozer Cem KelahmetTabular LearningTabular Data

  42. LARGO: Low-Rank Hypernetwork for Handling Missing Modalities

    May 7, 2026Niels Vyncke, Pooya Ashtari, Aleksandra PižuricaMissing ModalitiesModalities

  43. To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition

    May 6, 2026Yangchen Yu, Qian Chen, Jia Li +5Emotion RecognitionCross-Modal

  44. Information Coordination as a Bridge: A Neuro-Symbolic Architecture for Reliable Autonomous Driving Scene Understanding

    May 6, 2026Shuo Liu, Lei Shi, Haowen Liu +3Autonomous DrivingCollaborative Perception

  45. Triple Spectral Fusion for Sensor-based Human Activity Recognition

    May 4, 2026Ye Zhang, Longguang Wang, Qing Gao +3Human Activity RecognitionTwo-Level Spatial-Frequency Fusion Strategy

  46. Structured Diffusion Bridges: Inductive Bias for Denoising Diffusion Bridges

    May 3, 2026Eitan Kosman, Gabriele Serussi, Chaim BaskinDiffusion BridgesCross-Modal

  47. Multimodal Data Curation Through Ranked Retrieval

    May 1, 2026Pratyush Muthukumar, Harshil Kotamreddy, Sarah Amiraslani +4Multimodal EmbeddingsCross-Modal

  48. EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness

    May 1, 2026Yueru Sun, Yimeng Zhang, Haoyu Gu +5Emotion RecognitionMultimodal Large Language Models

  49. Jailbreaking Vision-Language Models Through the Visual Modality

    May 1, 2026Aharon Azulay, Jan Dubiński, Zhuoyun Li +2Large Language Model JailbreaksSafety Alignment

  50. Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration

    May 1, 2026Chunlei Meng, Pengbin Feng, Rong Fu +7Multimodal LearningCross-Modal