Cross-Modal Attention

Momentum

9 papers in the last four weeks, up 125% on the four weeks before. 0.1% of all new papers.

Jul 13Week of Sep 28

Latest papers 81

All topics
CardsList
  1. Beyond Attention Imbalance: Mitigating Hallucinations via Spectral Surgery

    Sep 29, 2026Siqi Lu, Suo Wei, Yongbin Zheng +3Recent Vision-Language ModelsVisual Hallucinations

  2. Mind What Matters for Reasoning: Aligning Cross-Modal Attention via Selective Probability Mass Concentration

    Sep 24, 2026Jiaqi Deng, Zonghan Wu, Zhan Heng +3Multimodal ReasoningMultimodal Large Language Models

  3. Integrating Local Detail and Global Context: A Dual-Input Multi-Task Learning Framework for Bone Tumor Diagnosis

    Sep 23, 2026S. M. Nasif Uddin, Rusab Sarmun, Muhammad E. H. Chowdhury +3LesionTumor

  4. Detecting Phone-Induced Pedestrian Distraction via a Multimodal Fusion Transformer

    Sep 20, 2026Yuanzhe Li, Hounian Liu, Xiaotong Chang +1PedestrianDetection Transformer

  5. Cross-Modal Attention Acts as a Frequency Filter: Why Verbose Prompts Improve Robustness in Vision-Language Models

    Sep 17, 2026Farooq Ahmad Wani, Maria Sofia Bucarelli, Mujtaba Hussain Mirza +5Cross-Modal AttentionPrompt Engineering

  6. CCMAN: Cognitive Instability-Aware Cross-Modal Attention Network for Interpretable Temporal Biomarkers of Verbal Fluency Speech

    Sep 13, 2026Madhurananda Pahar, Caitlin Illingworth, Dorota Braun +2Cross-Modal AttentionBiomarker

  7. Exploring Diffusion Transformers for Cross-Modal Augmentation in Multimodal Brain State Decoding

    Sep 12, 2026Ziwei Wang, Xingyi He, Hongbin Wang +3Cross-Modal AttentionMultimodal Learning

  8. The Attention Triangle in Audio-Video Models

    Sep 3, 2026Sagi Polaczek, Noa Kraicer, Gal Metzer +4Cross-Modal AttentionAudio-Video Generation

  9. Detecting Object Hallucinations in Large Vision-Language Models via Cross-Modal Attention Drifts and Mask-Based Verification

    Sep 2, 2026Xuanbing Wen, Boxu Chen, Le Yang +4Citation Hallucination DetectionObject Hallucination

  10. Forbid Your Attention: Fooling Multimodal Large Language Models by Selectively Removing Intrinsic Focus in Spectral Domain

    Sep 1, 2026Daizong Liu, Junhao Dong, Zhiyuan Ma +6Multimodal Large Language ModelsCross-Modal Attention

  11. DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

    Aug 31, 2026Jiashu Zhu, Yanhao Zheng, Ruitian Tian +7Audio-Video GenerationMultimodal Generation

  12. C3^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

    Aug 5, 2026Swapnanil Mukherjee, Agyeya Negi, Tanuja Ganu +1Cross-Modal ConflictsCross-Modal

  13. Generic Vision and Cross-Attention for Reaction Yield Prediction

    Aug 1, 2026Qiwei Han, Chi ZhouMolecular Property PredictionReaction

  14. VCP-DCN: Beyond Visual Concealed Property via Depth Collaborative Network for Camouflaged Object Detection

    Jul 30, 2026Songsong Duan, Xi Yang, Nannan WangCamouflaged Object DetectionCross-Modal Attention

  15. SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

    Jul 28, 2026Yuchen Wang, Qihui Zhu, Yang Liu +2Visual Token PruningLong Visual-Token Sequences

  16. I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models

    Jul 28, 2026Yimao Guo, Zuomin Qu, Wei LuDiffusion TransformersBlack-Box Adversarial Attacks

  17. Disentangling Semantic Attention from Structural Bias in the Attention Manifold

    Jul 27, 2026Pengkun Jiao, Bin Zhu, Jingjing Chen +1Cross-Modal AttentionMultimodal Large Language Models

  18. MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving

    Jul 26, 2026Zhijing Cheng, Xuancheng Zhang, Donglin Di +4Causality-Aware End-To-End Autonomous DrivingAutonomous Driving

  19. Multimodal Domain Generalization for Depression Detection: An Attention-Based BiLSTM Network with Domain-Adversarial Training

    Jul 24, 2026Ali Tabaraei, Federico Simonetta, Stavros NtalampirasDepressionMultimodal Deep Learning

  20. Learning to Detect Cross-Modal Negation: An Analysis of Latent Representations and an Attention-Based Solution

    Jul 20, 2026Ali AbuSaleh, Leon Hammerla, Alexander MehlerCross-Modal AttentionNegation

  21. ChemFusion: A Multimodal Cross-Attention Network for Reaction Yield Prediction

    Jul 19, 2026Qiwei Han, Chi ZhouReactionHeterogeneous Catalysis

  22. On the Geometry of Learned Representations in Event-Based Multi-Modal Egomotion Estimation

    Jul 17, 2026Stefano Silvestrini, Michele CeresoliEgocentric Motion GenerationMulti-Sensor Fusion

  23. Adaptive Cross-Modal Fusion with Sparse Attention for Pedestrian Crossing Intention Prediction

    Jul 14, 2026Md Mahfuzur Rahman, Pengzhan Zhou, A F M Abdun Noor +5Pedestrian Trajectory PredictionCross-Modal Fusion

  24. Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering

    Jul 4, 2026SungHun Kim, SeungJun BaekAudio-Visual ReasoningCross-Modal Attention

  25. ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation

    Jul 4, 2026Ahmed Abul Hasanaath, Bicheng Xu, Mir Rayat Imtiaz Hossain +2Gloss-Free Sign Language TranslationVideo Multimodal Large Language Models

  26. Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation

    Jul 1, 2026Jaehyun Jang, Eunseop Yoon, Hee Suk Yoon +3Knowledge DistillationFew-Step Distillation

  27. ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

    Jun 30, 2026Zhiyuan Yao, Zheren Fu, Zhixiao Zheng +3Multimodal Large Language ModelsLarge Language Model Hallucination

  28. Steering Vision-Language Models with Joint Sparse Autoencoders

    Jun 24, 2026Huizhen Shu, Xuying Li, Hongxu Lin +2Improving Sparse AutoencodersCross-Modal Attention

  29. Cross-Attention Multimodal Learning for Predicting Response to Neoadjuvant Imatinib in Gastrointestinal Stromal Tumors: A Multicenter Retrospective Study

    Jun 24, 2026Fariba Tohidinezhad, Douwe J. Spaanderman, Natalia Oviedo Acosta +14Multicenter EvaluationColorectal Cancer

  30. iFLYTEK-Embodied-Omni Technical Report

    Jun 24, 2026Yuan Zhang, Jingfei Ni, Guanchen Lu +12Action GenerationCross-Modal Attention

  31. Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

    Jun 23, 2026Bin Chen, Yuxiang Cai, Yadan Luo +3Visual Token PruningCross-Modal Attention

  32. Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs

    Jun 22, 2026Chuangxin Zhao, Canran Xiao, Siyuan Ma +5Multimodal Large Language ModelsCross-Modal Attention

  33. Three-Step Hierarchical Transformer for Multi-Pedestrian Trajectory Prediction

    Jun 22, 2026Raphaël Delécluse, Hazem Wannous, Laurent Grisoni +1Pedestrian Trajectory PredictionSpatio-Temporal Transformers

  34. Multi-Modal Attention for Automated Disaster Damage Assessment Using Remote Sensing Imagery and Deep Learning

    Jun 12, 2026Tewodros Syum Gebre, Jagrati Talreja, Leila Hashemi-BeniPost-Disaster Damage AssessmentRemote Sensing

  35. Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

    Jun 10, 2026Tianhao Chen, Yuheng Wu, Kelu Yao +3Key-Value Cache CompressionMultimodal Large Language Models

  36. Multimodal Brain Tumour Classification Using Feature Fusion

    Jun 9, 2026Wajih ul Islam, Muhammad Yaqoob, Javed Ali Khan +1Brain Tumor ClassificationRadiomics

  37. Multi-View Speech Representation Learning for Parkinson's Disease Detection Using Context-guided Cross-modal Attention

    Jun 8, 2026George Theodosiou, Loukas Ilias, Dimitris AskounisDiscrete Speech RepresentationsDysarthric Speech

  38. GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention

    Jun 4, 2026Giordano Cicchetti, Eleonora Grassucci, Danilo ComminielloCross-Modal AttentionModalities

  39. Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM

    Jun 3, 2026SooHwan Eom, Jay Shim, Gwanhyeong Koo +4Multimodal Large Language ModelsCross-Modal Attention

  40. Attend to Anything: Foundation Model for Unified Human Attention Modeling

    Jun 2, 2026Wenzhuo Zhao, Ronghao Xian, Keren Fu +1Cross-Modal AttentionSaliency

  41. Spectral-Progressive Thought Flow for Lightweight Multimodal Reasoning

    Jun 1, 2026Yixian Shen, Zhiheng Yang, Qi Bi +6Multimodal ReasoningVisual Reasoning

  42. DeepIPCv3: Event-Aware Multi-Modal Sensor Fusion for Sudden Pedestrian Crossing Avoidance

    May 31, 2026Oskar Natan, Andi Dharmawan, Aufaclav Zatu Kusuma Frisky +2Multi-Sensor FusionAutonomous Navigation

  43. Unveiling the Fragility of Vision-Language Models: Multi-Modal Adversarial Synergy via Texture-Constrained Perturbations and Cross-Modal Optimization

    May 26, 2026Xiang Fang, Wanlong Fang, Changshuo WangRecent Vision-Language ModelsCross-Modal Attention

  44. Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

    May 25, 2026Bonan Ding, Umair Nawaz, Ufaq Khan +5Fine-Grained Video UnderstandingCross-Modal Attention

  45. Stage-adaptive Token Selection for Efficient Omni-modal LLMs

    May 19, 2026Zijie Xin, Jie Yang, Ruixiang Zhao +4Omni-ModalCross-Modal Attention

  46. RAVE: Re-Allocating Visual Attention in Large Multimodal Models

    May 18, 2026Xi Leng, Xinhong Ma, Ziqiang Dong +4Cross-Modal AttentionLarge Multimodal Models

  47. See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding

    May 18, 2026Boyuan Sun, Bowen Yin, Yuanming Li +2Fine-Grained PerceptionVisual In-Context Learning

  48. CAM-VFD: Cross-Attention Multimodal Video Forgery Detection

    May 16, 2026Hoda Osama Elkhodary, Sherin Mostafa Youssef, Marwa Elshenawy +1Deepfake DetectionAi-Generated Video Detection

  49. MaTe: Images Are All You Need for Material Transfer via Diffusion Transformer

    May 15, 2026Nisha Huang, Henglin Liu, Yizhou Lin +5Diffusion TransformersDiffusion Models

  50. MHSA: A Lightweight Framework for Mitigating Hallucinations via Steered Attention in LVLMs

    May 14, 2026Wei Ding, Yilin Li, Yudong Zhang +4Hallucination MitigationGenerative Hallucination

  51. Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention

    May 12, 2026Abid Ali, Diego Molla-Aliod, Usman NaseemCross-Modal AttentionSummarization