Modalities

Momentum

33 papers in the last four weeks, up 154% on the four weeks before. 0.3% of all new papers.

Jul 13Week of Sep 28

Latest papers 217

All topics
CardsList
  1. Omni-Embed-Mini: Binding Modalities Without Forgetting via Dense Distillation

    Oct 1, 2026Mohammed Irfan Kurpath, Jaseel Muhammad Kaithakkodan, Sahal Shaji Mullappilly +2Multimodal EmbeddingsOmni-Modal

  2. SIEVE: Selective attention-value Suppression for Vision-Language Models Unlearning

    Oct 1, 2026Si Qi Goh, Cap Dang Xuan Kiet, Tat-Jen Cham +1Exact UnlearningForgetting

  3. When Integral Meets Decomposition: A Signal-Level Self-Supervised Feature Decompose Paradigm for Multi-Modal Image Fusion

    Sep 30, 2026Zeyu Wang, Jiayu Wang, Haiyu Song +1Multimodal FusionVisible Image Fusion

  4. Beyond Spatial-Domain Supervision: A Relation Constrained Space for Multi-Modal Image Fusion

    Sep 30, 2026Zeyu Wang, Mingyu Ge, Haiyu Song +1Visible Image FusionSpatial Supervision

  5. Prototype-guided Bilateral Alignment Multimodal Federated Learning

    Sep 30, 2026Tianchi Liao Tianchi_Liao, Lele Fu, Sheng Huang +3Heterogeneous Federated LearningMultimodal Alignment

  6. What Comes Next? Omni-StoryBench for Evaluating Story-Grounded Omnimodal Generation

    Sep 29, 2026Sieun Hyeon, Yejoon Lee, Mintaek Lim +3Omni-ModalMultimodal Generation

  7. End-to-End Self-Supervised RGB-T Tracking without Modality Misleading

    Sep 29, 2026Shenglan Li, Rui Yao, Kunyang Sun +4Rgb-Event Object TrackingRgb-Thermal

  8. Multimodal Detection of Higher-Order Behavioral Constructs: Self-Compassion in Structured Reflective Interaction

    Sep 29, 2026Siddhant Jain, Dimitra TsovaltziEmpathyReflections

  9. OmniRoute: Mapping Temporal Semantic Evidence to Audio-Visual Token Budgets for Efficient Omnimodal Large Language Models

    Sep 29, 2026Yuchen Deng, Zidang Cai, Feidiao Yang +4Omni-ModalAudio-Visual Reasoning

  10. Proofs Without Nominals: Gödel's Ontological Argument, its Shallow Embedding, and the Open Questions of the Monatshefte Notes

    Sep 28, 2026Christoph BenzmüllerFirst-Order LogicAxiom

  11. Render Before Reading: Visual Rendering as a Prompt Injection Defense

    Sep 28, 2026Jie Zhang, Andrei Baroian, Jan N. van Rijn +2Indirect Prompt InjectionMultimodal Large Language Models

  12. Multimodal Target Speaker Extraction: Towards Unified Speaker Cues Across Modalities

    Sep 28, 2026Xinyuan Qian, Yanghao Zhou, Ziyang Jiang +10Target Speaker ExtractionSpeaker

  13. Structured Latent Modeling for Supervised Multimodal Information Decomposition

    Sep 28, 2026Wanting Huang, Sanvesh Srivastava, Weiran WangMultimodal LearningMultimodal Classification

  14. Do Emotion Concepts Generalize Across Sources, Modalities, and Architectures in Vision-Language Models?

    Sep 28, 2026Bohao Xing, Xin Liu, Kaishen Yuan +5Emotion RecognitionEmotion

  15. Binding Multiple Modalities via Multimodal Wasserstein Barycenter

    Sep 27, 2026Xiaole Tang, Jiayi Xu, Xiang Gu +2Multimodal AlignmentComplementary Modalities

  16. MoGround: Measuring and Mitigating Modality Distraction in Vision-Language Models

    Sep 27, 2026Luca Zhou, Bo Zhao, Rose Yu +2ModalitiesMultimodal Query

  17. PhyMo: A Physical-Field Modality for Multimodal AI4Physics

    Sep 23, 2026Henan Sun, Haitao Hu, Jin Liu +4Multimodal RepresentationsModalities

  18. Displacement Geometry Captures Platonic Shared Reality Across Models and Modalities

    Sep 21, 2026Chenming Shang, Yujin Tang, Jun Jie Ou Yang +3Representation SpaceModalities

  19. GeoBalance: Geometry-Aware Monitoring and Reconstruction with Asymmetric Optimization for Balanced Multimodal Learning

    Sep 20, 2026Zechang Xiong, Da Li, Rong Yin +7Multimodal LearningMultimodal Classification

  20. CSC: Calibrated Simplicity for Conflict-Aware Social Bot Detection in the LLM Era

    Sep 20, 2026Yipeng Qian, Pengjie Zhao, Chaoxi NiuAi-Generated Content DetectionCamouflage

  21. The Unbearable Weight: Scaling Models and Methods for UAV Audio Classification

    Sep 15, 2026Andrew P. Berg, Qian Zhang, Mia Y. WangDrone DetectionUnmanned Aerial Vehicles

  22. LatentVerse: A Framework for Understanding Shared and Modality-Specific Information in Multimodal Latent Representations

    Sep 14, 2026Majd Alafrange, Samuel Friedman, John Kitonyo +2ModalitiesRepresentation Quality

  23. Func-R1: Incentivizing Mathematical Function Reasoning in Multimodal Large Language Models

    Sep 13, 2026Mingze Yin, Xiaohan Wang, Dian Li +8Mathematical ReasoningMultimodal Large Language Models

  24. Prototype Matters: Modality-unified Prototype Self-distillation for Unsupervised Visible-infrared Person Re-identification

    Sep 11, 2026Menglin Wang, Xiaojin GongRe-IdentificationCross-Modality

  25. Predictive Multi-Landmark OCT Tracking for Increased Motion Robustness

    Sep 11, 2026Konrad Reuter, Suresh Guttikonda, Chaitali Uday Karekar +2Multi-Object TrackingMotion Estimation

  26. The Illusion of Balanced Multimodal Sentiment Analysis: Beyond the Limits of Optimization-Based Methods

    Sep 11, 2026Ioanna Kaffeza, Efthymios Georgiou, Alexandros PotamianosMultimodal Sentiment AnalysisModalities

  27. UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation

    Sep 11, 2026Danning Zhang, Yijing Lin, Shuhan Zhuang +4Multimodal GenerationMulti-Reference Image Generation

  28. When Fusion Fails: Corruption-Aware Rebalanced Fusion for Multi-Modal Medical Image Segmentation

    Sep 9, 2026Yuchen Pei, Xiaoyu Hu, Yixiong Zou +5Semi-Supervised Medical Image SegmentationMultimodal Fusion

  29. Multimodal Emotion Recognition in Conversations via Class-Wise Adaptive Modality Fusion and Affective Geometry

    Sep 9, 2026Oriol Marín, Roger Marí, Gloria Haro +1Emotion RecognitionMultimodal Fusion

  30. SimpleDesign: A Joint Model for Protein Sequence and Structure Codesign

    Sep 3, 2026Jiarui Lu, Yuyang Wang, Yizhe Zhang +4Protein DesignGenerative Models

  31. Sensing Which Modality Matters: Evidence-Gated Regularization for Robust VLA Policies

    Sep 2, 2026Yue Yang, Diego Romeres, Chiori Hori +3Sensory FeedbackModalities

  32. Slow to See, Slow to Suppress: Understanding the Effects of Modality in Context-Memory Conflicts

    Aug 31, 2026Athulith Paraselli, Etha Tianze Hua, Ellie PavlickModalitiesFactual Recall

  33. Do VLMs Share Safety Neurons Across Modalities?

    Aug 31, 2026Jiaxuan Li, Jiahao Zhang, Duc Minh Vo +3Multimodal BenchmarksNeurons

  34. Modality Disentangled Learning for Incomplete Multimodal Emotion Recognition: A Primitive Memory Distillation Perspective

    Aug 31, 2026Jiaqi Zhang, Zheng Pang, Mengting Li +9Multimodal LearningEmotion Recognition

  35. TAKE 85: Testing Audiovisual filmmaKer's intEnt across 85 Hours of Film

    Aug 30, 2026Kaishuu Shinozaki-Conefrey, Olivier Pascaud, Robin Courant +3FilmsDramadirector

  36. P2Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation

    Aug 13, 2026Yi Shi, Huichao Xie, Yuqing Wang +7Infrared-Visible Image FusionAdm-Fusion

  37. Dual Anchors, Do It Better: Hierarchical Group Merging for Zero-Shot Anomaly Detection

    Aug 12, 2026Jimin Roh, DongKyu Kim, Suk-Ju KangSparse Spatial AnchorsModalities

  38. Dual Modality Prompted Diffusion Priors for Zero Shot Hyperspectral Pansharpening

    Aug 12, 2026Pengwei Xie, Fei Zhu, Jiajun Li +4Hyperspectral ImageMultimodal Diffusion Models

  39. TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation

    Aug 11, 2026Pengyu Zhang, Yangqin Jiang, Klim Zaporojets +2Multimodal Recommendation ModelModalities

  40. DINO-A: Adapting Self-Distillation Vision Transformers to General Audio Representation Learning

    Aug 11, 2026Tomasz Radzikowski, Mateusz Modrzejewski, Przemysław RokitaNeural AudioDino

  41. Sequential Modality Dropout for Robust Multi-Modal Sequential Recommendation

    Aug 10, 2026Guanqun Yang, Wenlong ZhangMultimodal Recommendation ModelModalities

  42. Multimodal Federated Learning under Dual-Axis Modality Missingness

    Aug 10, 2026Adiba Orzikulova, Jaehyun Kwak, Jaemin Shin +5Federated LearningMissing Modalities

  43. Learning Deep Modality-Shared Self-Expressiveness for Image Clustering with Textual Information

    Aug 9, 2026Xianghan Meng, Wei He, Zhiyuan Huang +1Multimodal RepresentationsModalities

  44. Conformal Fusion Under Missing Modalities

    Aug 7, 2026Alireza MoayedikiaMissing ModalitiesMultimodal Fusion

  45. LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents

    Aug 7, 2026Ivan Majic, Zexian Huang, Franziska Hübl +5Large Multimodal ModelsSpatial Reasoning

  46. AnyTrack: Unifying Visual Object Tracking with Any Modalities

    Aug 7, 2026Hao Li, Yunzhi Zhuge, Wenning Hao +4Multi-Object TrackingModalities

  47. C3^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

    Aug 5, 2026Swapnanil Mukherjee, Agyeya Negi, Tanuja Ganu +1Cross-Modal ConflictsCross-Modal

  48. SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

    Aug 5, 2026Yue Zhang, Yingzhao Jian, Yunqiu Xu +23D Scene UnderstandingMultimodal Reasoning

  49. OPD-V: Visual On-Policy Self-Distillation with Modality Balance

    Aug 5, 2026Aniri, Jinhe Bi, Peng Liao +5Multimodal Large Language ModelsRecent Vision-Language Models

  50. UG-UMRE: Uncertainty-Guided Modality Augmentation and Distributional Calibration for Unified Multimodal Relation Extraction

    Aug 5, 2026Bo Kong, Liruiz Jia, Yi Liang +5Cross-ModalModalities

  51. Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition

    Aug 5, 2026Zehao Bao, Shujun Guo, Bruce X. B. YuSkeleton-Based Action RecognitionZero-Shot

  52. AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities

    Aug 4, 2026Sandy Abdo, Bill Kapralos, Priyamvada Tripathi +2Modern Generative Audio ModelsGenerative Artificial Intelligence