Modality Alignment

Latest papers 23

All topics
CardsList
  1. Narrow Multimodal Fine-Tuning Can Induce Emergent Misalignment

    Sep 28, 2026Shunchang Liu, Lukas Fluri, Xin Chen +1Emergent MisalignmentModality Alignment

  2. Alignment-Guided Flow Transformer for Efficient Vision-Language-Action Policy Learning

    Sep 28, 2026Shengchao Hu, Peng Wang, Qiyang Zhou +5Flow-Matching Vision-Language-ActionGeneralizable Vision-Language-Action Policies

  3. MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

    Aug 11, 2026Changhao Xiang, Shangyu Xing, Zhen Wu +2Multimodal PretrainingMultimodal Large Language Models

  4. UniMod: Enhancing Multi-Modal Medical Diagnosis through Cross-Modality and Within-Modality Alignment

    Aug 10, 2026Zijian Gu, Weikai Lin, Shuang Zhou +2Multimodal Clinical DataCross-Modality

  5. From Cheap Fakes to Pure Synthesis: Addressing the New Era of T2V Fake News Videos

    Aug 7, 2026Yifeng Luo, Yupeng Li, Liang Lan +1Fake News DetectionFake News

  6. TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

    Aug 4, 2026Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman +4Aerial ImageryModality Alignment

  7. Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval

    Jul 1, 2026Runhao Li, Xiaoxu Ma, Zhenyu Weng +5Cross-ModalModality Alignment

  8. MAGE: View-guided Point Cloud Completion with Efficient Modality Alignment and Adaptive Geometry Enhancement

    Jun 30, 2026Weize Quan, Zhengwei Wu, Kai Wang +1Point CloudsModality Alignment

  9. Enhancing Multilingual LLM-based ASR with Mixture of Experts and Dynamic Downsampling

    Jun 9, 2026Guodong Lin, Ziqi Chen, Yuxiang Fu +2End-To-End Automatic Speech Recognition ModelsAutomatic Speech Recognition

  10. DeRA-MOS: Optimizing Text-to-Music Evaluation via Decoupled Listwise Ranking and Modality Alignment

    Jun 8, 2026Chien-Chun Wang, Hung-Shin Lee, Hsin-Min Wang +1Text-To-MusicSeed-Tts-Eval Benchmark

  11. OVA-IB: One vs All Information Bottleneck for Multi-Modal Alignment

    May 28, 2026Tianchao Li, Shujian Yu, Xinrui Zu +4Multimodal AlignmentModality Alignment

  12. STaT: Resolving Shape Distortion in Non-Stationary Time Series via Tri-Modal Synergy

    May 25, 2026Hui Cheng, Jinsheng Guo, Zhenhao Weng +2Multivariate Time Series ForecastingNon-Stationarity

  13. CyberCorrect: A Cybernetic Framework for Closed-Loop Self-Correction in Large Language Models

    May 17, 2026Yuning Wu, Yingmin Liu, Yang ShuIterative Self-CorrectionLarge Language Models Fail

  14. Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages

    May 16, 2026Firoj Alam, Shammur Absar Chowdhury, Enamul Hoque PrinceMultilingualLow-Resource Languages

  15. SMA: Submodular Modality Aligner For Data Efficient Multimodal Learning

    May 13, 2026Truong Pham, Anay Majee, Rishabh IyerMultimodal AlignmentModality Alignment

  16. Anisotropic Modality Align

    May 8, 2026Xiaomin Yu, Yijiang Li, Yuhui Zhang +8Modality Alignment

  17. UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

    May 1, 2026Houyuan Chen, Hong Li, Xianghao Kong +8Video Diffusion ModelsMultimodal Diffusion Models

  18. Closing the Speech-Text Gap with Limited Audio for Effective Domain Adaptation in LLM-Based ASR

    Apr 7, 2026Thibault Bañeras-Roux, Sergio Burdisso, Esaú Villatoro-Tello +9Automatic Speech RecognitionSpeech Encoder

  19. EGRA:Toward Enhanced Behavior Graphs and Representation Alignment for Multimodal Recommendation

    Aug 22, 2025Xiaoxiong Zhang, Xin Zhou, Zhiwei Zeng +2Multimodal Recommendation ModelModality Alignment