Audio-Visual Understanding

Latest papers 95

All topics
CardsList
  1. OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

    May 12, 2026Yuchen Deng, Zidang Cai, Hai-Tao Zheng +3Audio-Visual UnderstandingEfficient Multimodal Inference

  2. Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs

    May 12, 2026Chaeyoung Jung, Kyeongha Rho, Joon Son ChungAudio-Visual UnderstandingEfficient Multimodal Inference

  3. LightAVSeg: Lightweight Audio-Visual Segmentation

    May 9, 2026Qing Zhong, Guodong Ding, Lingqiao Liu +3Audio-Visual UnderstandingAudio-Visual Alignment

  4. EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing

    May 9, 2026Huilai Li, Xiaomeng Di, Ying Xing +3Audio-Visual UnderstandingWeakly Supervised Learning

  5. TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos

    May 8, 2026Hengyi Feng, Hao Liang, Mingrui Chen +6Audio-Visual UnderstandingMultimodal Hallucination

  6. MMTB: Evaluating Terminal Agents on Multimedia-File Tasks

    May 8, 2026Chiyeong Heo, Jaechang Kim, Junhyuk Kwon +4Computer-Use Agent BenchmarksAudio-Visual Understanding

  7. PRIMED: Adaptive Modality Suppression for Referring Audio-Visual Segmentation via Biased Competition

    May 8, 2026Yuchen He, Jing ZhangAudio-Visual UnderstandingReferring Expression Segmentation

  8. Audio-Visual Intelligence in Large Foundation Models

    May 5, 2026You Qin, Kai Liu, Shengqiong Wu +12Audio-Visual UnderstandingAudio-Video Generation

  9. KARMA-MV: A Benchmark for Causal Question Answering on Music Videos

    May 5, 2026Archishman Ghosh, Abhinaba Roy, Dorien HerremansAudio-Visual UnderstandingVideo QA

  10. Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning

    May 3, 2026Xinmeng Xu, Haoran Xie, S. Joe Qin +3Audio-Visual UnderstandingAudio-Visual Representation Learning

  11. OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder

    May 2, 2026Detao Bai, Shimin Yao, Weixuan Chen +4Cross-Modal LearningVideo Understanding

  12. Are DeepFakes Realistic Enough? Exploring Semantic Mismatch as a Novel Challenge

    Apr 30, 2026Sharayu Nilesh Deshmukh, Kailash A. Hambarde, Joana C. Costa +2Audio-Visual UnderstandingAudio Deepfake Detection

  13. Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning

    Apr 27, 2026Zhicheng Zhang, Wentao Gu, Weicheng Wang +5Audio-Visual UnderstandingTree Search

  14. Exploring Audio Hallucination in Egocentric Video Understanding

    Apr 26, 2026Ashish Seth, Xinhao Mei, Changsheng Zhao +9Audio-Visual UnderstandingHallucination in Language Models

  15. APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track

    Apr 20, 2026Deshui Miao, Yameng Gu, Chao Yang +3Audio-Visual UnderstandingVideo Object Segmentation

  16. AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

    Apr 17, 2026Edson Araujo, Saurabhchand Bhati, M. Jehanzeb Mirza +5Cross-Modal LearningAudio-Visual Understanding

  17. AViS-Mamba: Adaptive Visual Steering of Audio State-Space Dynamics for Violence Detection

    Apr 2, 2026Damith Chamalke Senadeera, Dimitrios Kollias, Gregory SlabaughAudio-Visual UnderstandingAudio-Visual Representation Learning

  18. HumanOmni-Speaker: Identifying Who said What and When

    Mar 23, 2026Detao Bai, Zhiheng Ma, Xihan WeiAudio-Visual UnderstandingVisual Speaker Recognition

  19. SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models

    Mar 17, 2026Tianyu Xie, Jinfa Huang, Yuexiao Ma +11Audio-Visual UnderstandingSpoken Dialogue Systems

  20. DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression

    Mar 15, 2026Bingzhou Li, Tao HuangAudio-Visual UnderstandingEfficient Multimodal Inference

  21. Audio-Visual Continual Test-Time Adaptation without Forgetting

    Feb 20, 2026Sarthak Kumar Maharana, Akshay Mehra, Bhavya Ramakrishna +2Cross-Modal LearningSource-Free Domain Adaptation

  22. TAC: Timestamped Audio Captioning

    Feb 17, 2026Sonal Kumar, Prem Seetharaman, Ke Chen +8Audio CaptioningTemporal Audio Grounding

  23. TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

    Feb 9, 2026Linli Yao, Yuancheng Wei, Yaojie Zhang +12Audio-Visual UnderstandingVideo Captioning

  24. SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

    Jan 29, 2026Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum +2Audio-Language Model EvaluationMultimodal Grounding

  25. AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking

    Jan 25, 2026Xilin Jiang, Qiaolin Wang, Junkai Wu +30Audio-Visual UnderstandingMultimodal Large Language Models

  26. Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation

    Dec 23, 2025Jingqi Tian, Yiheng Du, Haoji Zhang +6Audio-Visual UnderstandingAudio-Visual Representation Learning

  27. Taming Modality Entanglement in Continual Audio-Visual Segmentation

    Oct 20, 2025Yuyang Hong, Qi Yang, Tao Zhang +5Audio-Visual UnderstandingReplay-Based Continual Learning

  28. Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

    Sep 22, 2025Geewook Kim, Minjoon SeoVLM EvaluationAudio-Visual Understanding

  29. VGGSounder: Audio-Visual Evaluations for Foundation Models

    Aug 11, 2025Daniil Zverev, Thaddäus Wiedemer, Ameya Prabhu +3Audio-Visual UnderstandingMultimodal Classification

  30. Towards AI-Driven Policing: Interdisciplinary Knowledge Discovery from Police Body-Worn Camera Footage

    Date pendingAnita Srbinovska, Angela Srbinovska, Vivek Senthil +4Audio-Visual UnderstandingVideo Surveillance