Modality-Specific Encoders

Momentum

0 papers in the last four weeks, against 1 the four weeks before. 0.0% of all new papers.

Jul 6Week of Sep 21

Latest papers 32

All topics
CardsList
  1. OmniRoute: Mapping Temporal Semantic Evidence to Audio-Visual Token Budgets for Efficient Omnimodal Large Language Models

    Sep 29, 2026Yuchen Deng, Zidang Cai, Feidiao Yang +4Omni-ModalAudio-Visual Reasoning

  2. Towards Unified Dynamic Face Landmark Detection

    Aug 11, 2026Sebastian Regalado, Varshanth R. Rao, Ruowei Jiang +2One-Shot Medical Landmark DetectionModality-Specific Encoders

  3. MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

    Jul 28, 2026Mingqiao Ye, Zhaochong An, Zhitong Gao +11Modality-Specific EncodersComplementary Modalities

  4. OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

    Jul 25, 2026Jinsen Su, Yongdong Luo, Yuexiao Ma +3Token CompressionOmni-Modal

  5. Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

    Jul 9, 2026Dominick Reilly, Qiyu Wu, Hiromi Wakaki +2Multimodal Large Language ModelsModality-Specific Encoders

  6. Integrating Neural Encoders in Bayesian Generalized Linear Mixed Models for Multimodal Data

    Jul 6, 2026Yuankang Zhao, Youngsoo Baek, Felipe A. Medeiros +2Generalized Linear ModelMultimodal Learning

  7. OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

    Jul 3, 2026Shijie Cao, Qingyu Zhang, Boxi Yu +6Token CompressionAudio-Visual Reasoning

  8. TactX: Learning Shared Tactile Representations Across Diverse Sensors

    Jun 30, 2026Junsung Park, Sachin Bhadang, Carmelo Sferrazza +2TactileTac

  9. LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features

    Jun 26, 2026Jonghyeon Park, Olivier Jiyoun Jung, Myungwoo OhAlzheimerSpeaker

  10. AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

    Jun 23, 2026Yijing Chen, Wenhui Tan, Xiaoyi Yu +7Audio-Visual ReasoningLarge Audio Language Models

  11. TactSpace: Learning a Physics-enriched Shared Latent Space for Tactile Sim-to-Real Transfer

    Jun 17, 2026Arunim Joarder, Arjun Bhardwaj, René Zurbrügg +6TactileSim-To-Real Reinforcement Learning

  12. Modality Forcing for Scalable Spatial Generation

    Jun 11, 2026Bardienus Pieter Duisterhof, Deva Ramanan, Jeffrey Ichnowski +2Multi-Reference Image GenerationDense Prediction

  13. V-LynX: Token Interface Alignment for Video+X LLMs

    May 30, 2026Jungin Park, Jiyoung Lee, Kwanghoon SohnModality-Specific EncodersRobotwin

  14. Two-Stage Multimodal Framework for Emotion Mimicry Intensity Prediction

    May 21, 2026Dinithi Dissanayake, Shaveen Silva, Ovindu Atukorala +2Emotion RecognitionModality-Specific Encoders

  15. Speech-Guided Multimodal Learning for Vocal Tract Segmentation in Real-Time MRI

    May 18, 2026Daiqi Liu, Lukas Mulzer, Md Hasan +11Vocal Tract ShapeMagnetic Resonance Imaging

  16. PRIMED: Adaptive Modality Suppression for Referring Audio-Visual Segmentation via Biased Competition

    May 8, 2026Yuchen He, Jing ZhangVideo Object SegmentationModality-Specific Encoders

  17. OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder

    May 2, 2026Detao Bai, Shimin Yao, Weixuan Chen +4Audio-Visual ReasoningOmni-Modal

  18. Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration

    May 1, 2026Chunlei Meng, Pengbin Feng, Rong Fu +7Multimodal LearningCross-Modal

  19. Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

    Apr 26, 2026Zhen Ye, Xu Tan, Aoxiong Yin +8Audio-Video GenerationAutoregressive Diffusion

  20. Uni-Encoder Meets Multi-Encoders: Representation Before Fusion for Brain Tumor Segmentation with Missing Modalities

    Apr 24, 2026Peibo Song, Xiaotian Xue, Jinshuo Zhang +5Brain Tumor SegmentationMagnetic Resonance Imaging

  21. Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

    Apr 22, 2026Yubo Jiang, Yitong An, Xin Yang +7Modality-Specific EncodersObject Hallucination

  22. OmniGCD: Abstracting Generalized Category Discovery for Modality Agnosticism

    Apr 16, 2026Jordan Shipard, Arnold Wiliem, Kien Nguyen Thanh +2Generalized Category DiscoveryModality-Specific Encoders

  23. DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression

    Mar 15, 2026Bingzhou Li, Tao HuangToken CompressionAudio-Visual Reasoning

  24. Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey

    Jul 21, 2025Jindong Li, Yali Fu, Jiahong Liu +5Large Language Model QuantizationMultimodal Large Language Models

  25. Structured-Noise Masked Modeling for Video, Audio and Beyond

    Mar 20, 2025Aritra Bhowmik, Carlos Hinojosa, Fida Mohammad Thoker +2Noise-AwareNeural Audio