Audio-Visual Understanding

Latest papers 94

All topics
CardsList
  1. MacJEPA: Missingness-Robust Audio-Visual Recognition from Untrimmed Egocentric Videos

    Oct 6, 2026Souptik Sen, Zahra AhmadiMissing-Modality LearningAudio-Visual Understanding

  2. OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

    Oct 1, 2026Haibo Wang, Jiteng Mu, Jialu Li +5Audio-Visual UnderstandingRL for Language Model Reasoning

  3. AVSD-Scenes: A Dataset for Audio-Visual Description of Urban Scenes

    Oct 1, 2026Dhanunjaya Varma Devalraju, Arshdeep Singh, Mark D. PlumbleyAudio-Visual UnderstandingCross-Modal Retrieval

  4. Supervising Sound Localization by In-the-wild Egomotion

    Oct 1, 2026Anna Min, Ziyang Chen, Hang Zhao +1Audio-Visual UnderstandingDirection-of-Arrival Estimation

  5. OP-CAD: On-Policy Clean-Audio Distillation for Robust Audio-Visual Reasoning

    Sep 30, 2026Xingming Shui, Dapeng Chen, Bowei Liu +5Audio-Visual UnderstandingMultimodal Robustness

  6. Uncovering Ordinal-Matching Bias in Audio-Visual LLMs

    Sep 28, 2026Jihoo Jung, Youngjoon Jang, Hyebin Cho +2Audio-Visual UnderstandingMultimodal Large Language Models

  7. Less is More: Encoder-only Audio-Visual Segmentation

    Sep 24, 2026Ilpo Viertola, Vladimir Iashin, Sophie Tötterström +1Audio-Visual UnderstandingEfficient ViTs

  8. ROAM-ASD: Robust Open-World Active Speaker Detection with Flexible Multimodal Fusion

    Sep 22, 2026Pu Wang, Hugo Van hammeAudio-Visual UnderstandingMultimodal Robustness

  9. Omni2Web: Benchmarking Audiovisual Website Development

    Sep 20, 2026Minghao Han, Zhenghao Xing, Xize Cheng +7Multimodal GroundingAudio-Visual Understanding

  10. OmniEcho: Audio-Visual Spatial Understanding for Omni-Modal Embodied Agents

    Sep 20, 2026Ruixun Liu, Yuxuan Wang, Jiacheng Xie +10Audio-Visual UnderstandingSpatial Reasoning Benchmarks

  11. E-AVI: Evidence-Grounded Multimodal Assessment for Automated Video Interviews

    Sep 17, 2026Haoshen Wang, Dongbo Che, Zeyi Xie +3Multimodal GroundingAudio-Visual Understanding

  12. AVTrace: Diagnosing Audio-Visual Temporal Reasoning in Omni Models

    Sep 17, 2026Longyin Zhang, Parth Sakhare Mahendra, Chengwei Wei +4Temporal Video GroundingAudio-Visual Understanding

  13. G-Mamba: Sparse Graph-Guided Mamba for Audio-Visual Speech Enhancement

    Sep 16, 2026Guo-Ruei Tseng, Hung-Shin Lee, Hsin-Min Wang +1Audio-Visual UnderstandingSpeech Enhancement

  14. Video-HolmesV2: Can MLLMs Reason with Spatio-Temporal Audio-Visual Evidence in Long Videos?

    Sep 15, 2026Zhaoyang Wei, Zipeng Wang, Yushe Cao +10Audio-Visual UnderstandingVideo-Language Model Evaluation

  15. Omni-Streaming Thinking

    Sep 14, 2026Enjun Du, Siyi Liu, Ziyu Zheng +4Audio-Visual UnderstandingStreaming Video Understanding

  16. Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs

    Sep 9, 2026Killian Steunou, Yannis Tevissen, Mounîm A. El YacoubiAudio-Visual UnderstandingEfficient VLM Inference

  17. From Visual Cues to Spoken Narration: Rethinking Audio Description

    Sep 1, 2026Akshita Gupta, Aditya Arora, Federico Tombari +2Audio-Visual Understanding

  18. TAKE 85: Testing Audiovisual filmmaKer's intEnt across 85 Hours of Film

    Aug 30, 2026Kaishuu Shinozaki-Conefrey, Olivier Pascaud, Robin Courant +3Audio-Visual UnderstandingVideo-Language Model Evaluation

  19. Towards Expert-level Medical AI for Real-time Video Consultations

    Aug 10, 2026Mahvish Nagda, Jihyeon Lee, Matthew Thompson +37Audio-Visual UnderstandingMedical VLMs

  20. Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework

    Aug 10, 2026Dongxu Ge, Shansong Liu, Cheng Gong +3Audio-Visual UnderstandingConditional Image Generation

  21. Agreement-Based Audio-Visual Segmentation:Champion Report for the MeViS-Audio Track in the 8th LSVOS Challenge

    Aug 10, 2026Yiwen Ren, Jianing Liu, Yingxin Wang +4Audio-Visual UnderstandingReferring Video Object Segmentation

  22. OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

    Jul 21, 2026Yu Chen, Caorui Li, Ziyu Xiong +8Temporal Video GroundingAudio-Visual Understanding

  23. Efficient Audio-Visual Event Recognition via Knowledge Distillation and Dynamic INT8 Quantization of a Hybrid Cross-Attention Network

    Jul 18, 2026Parinaz Binandeh Dehaghani, Danilo Pena, A. Pedro AguiarAudio-Visual UnderstandingNeural Network Compression

  24. Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

    Jul 17, 2026Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +19Audio-Visual UnderstandingMultimodal Large Language Models

  25. Video = World + Event Stream

    Jul 16, 2026Lianghua Huang, Zhi-Fan Wu, Yupeng Shi +24Audio-Visual UnderstandingStreaming Video Understanding

  26. AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

    Jul 14, 2026Yanghai Wang, Jiahao Wang, Jiafu Tang +9Audio-Visual UnderstandingAudio-Visual Alignment

  27. Empowering Long-form Omni-modal Understanding with Robust Audio Perception

    Jul 11, 2026Kaiying Yan, Luoyi Sun, Xiao Zhou +1Audio-Visual UnderstandingMultimodal Pretraining

  28. Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

    Jul 2, 2026Yuxuan Li, Lingxi Xie, Xinyue Huo +6Audio-Visual UnderstandingSpeaker Diarization

  29. Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning

    Jul 2, 2026Chen Zhao, Jiajun Ma, Qilong Huang +6Audio-Visual UnderstandingVideo Captioning

  30. MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

    Jun 29, 2026Yuxuan Fan, Gyusik Seo, Jing Hao +3Audio-Visual UnderstandingMultimodal Large Language Models

  31. AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

    Jun 23, 2026Yijing Chen, Wenhui Tan, Xiaoyi Yu +7Audio-Visual UnderstandingMultimodal Large Language Models

  32. Unlocking Spatial Grounding in Large Audio-Visual Retrieval models

    Jun 22, 2026Hugo Malard, Michel Olvera, Sanjeel Parekh +3Multimodal GroundingAudio-Visual Understanding

  33. Towards Accurate and Robust Surveillance Roadside IVD via Trackletized Audio-Visual Reasoning

    Jun 21, 2026Xiwen Li, Xiaoya Tang, Bodong Zhang +1Audio-Visual UnderstandingVideo Surveillance

  34. Native Active Perception as Reasoning for Omni-Modal Understanding

    Jun 17, 2026Zhenghao Xing, Ruiyang Xu, Yuxuan Wang +8Audio-Visual UnderstandingActive Perception

  35. MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild

    Jun 15, 2026Haotian Qi, Gabriel SkantzeMultimodal GroundingAudio-Visual Understanding

  36. Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning

    Jun 9, 2026Zihan Meng, Dexiang Hong, Weidong Chen +3Audio-Visual UnderstandingMultimodal Token Compression

  37. Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization

    Jun 5, 2026Zhe Yang, Ruyi Zhang, Hongtao Chen +4Audio-Visual UnderstandingHeterogeneous GNNs

  38. To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection

    Jun 4, 2026Erfan Loweimi, Mengjie Qian, Kate Knill +7Missing-Modality LearningAudio-Visual Understanding

  39. AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

    Jun 1, 2026Yaoting Wang, Ziyi Zhang, Wenming Tu +10Audio-Visual UnderstandingMultimodal Robustness

  40. AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes

    Jun 1, 2026Yaoting Wang, Yun Zhou, Zipei Zhang +1Audio-Visual UnderstandingInstance Segmentation

  41. Head-Pose-Aware Visual Speech Recognition with FiLM Modulation

    May 30, 2026Matthew Kit Khinn Teng, Haibo Zhang, Takeshi SaitohAudio-Visual UnderstandingVisual Speaker Recognition

  42. Sandboxed Coding Agents are Competitive Omni-modal Task Solvers

    May 30, 2026Dongping Chen, Xuanao Huang, Zhihan Hu +3Audio-Visual UnderstandingAI Coding Agents

  43. O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

    May 26, 2026Peiran Wu, Yunze Liu, Chi-Hao Wu +2Audio-Visual UnderstandingEfficient Multimodal Inference

  44. StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering

    May 25, 2026Ming Xie, Zizheng Huang, Xudong Tan +6Audio-Visual UnderstandingStreaming Video Understanding

  45. VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding

    May 21, 2026Haichen He, Jiayi Zhou, Sifeng Shang +3VLM EvaluationVideo Understanding

  46. LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

    May 21, 2026Yifan Dai, Zhenhua Wu, Bohan Zeng +18Cross-Modal LearningAudio-Visual Understanding

  47. OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding

    May 18, 2026Ruixiang Zhao, Jie Yang, Zijie Xin +4Audio-Visual UnderstandingStreaming Video Understanding

  48. Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks

    May 18, 2026Yajing Zhou, Xiangyu KongAudio-Visual UnderstandingVisual Spatial Reasoning

  49. IsoNet: Spatially-aware audio-visual target speech extraction in complex acoustic environments

    May 14, 2026Dinanath Padhya, Sajen Maharjan, Binita Adhikari +1Audio-Visual UnderstandingTarget Speaker Extraction

  50. When Vision Speaks for Sound

    May 13, 2026Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6Audio-Language Model EvaluationAudio-Visual Understanding