Audio-Visual Reasoning

Latest papers 77

All topics
CardsList
  1. LeAVJEPA: A Minimalist Architecture for Audio-Visual Self-Supervised Learning

    Oct 5, 2026Benjamin Robson, Santeri Mentu, Wenshuai Zhao +1Audio-Visual ReasoningNeural Audio

  2. OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

    Oct 1, 2026Haibo Wang, Jiteng Mu, Jialu Li +5Audio-Visual ReasoningOmni-Modal

  3. AVSD-Scenes: A Dataset for Audio-Visual Description of Urban Scenes

    Oct 1, 2026Dhanunjaya Varma Devalraju, Arshdeep Singh, Mark D. PlumbleyAudio-Visual ReasoningMultimodal Dataset

  4. MAV-C: A Framework for the Joint Objective Estimation of Audio-Visual Complexity in Immersive Virtual Environments

    Sep 30, 2026Luca Resti, Amelia Gully, Michael McLoughlin +2Audio-Visual ReasoningVirtual Reality

  5. LEAP: Learned Block-wise Evidence Retrieval for Long Audio-Video Perception

    Sep 30, 2026Juyi Lin, Zhiqiang Lao, Jiali Cui +9Audio-Visual ReasoningLong Video Question Answering

  6. OmniReasoning: Pushing the Limits of Audio-Visual Joint Reasoning

    Sep 30, 2026Junming Lin, Yuxuan Wang, Zhenxin Lei +11Audio-Visual ReasoningOmni-Modal

  7. OP-CAD: On-Policy Clean-Audio Distillation for Robust Audio-Visual Reasoning

    Sep 30, 2026Xingming Shui, Dapeng Chen, Bowei Liu +5Audio-Visual ReasoningProbe-Logit Distillation

  8. OmniRoute: Mapping Temporal Semantic Evidence to Audio-Visual Token Budgets for Efficient Omnimodal Large Language Models

    Sep 29, 2026Yuchen Deng, Zidang Cai, Feidiao Yang +4Omni-ModalAudio-Visual Reasoning

  9. SyncRA: Learning Temporal Correspondence in Omni-Modal Models

    Sep 28, 2026Zelong Xu, Yan Li, Wenhe Hu +1Audio-Visual ReasoningAudio-Visual Consistency

  10. Uncovering Ordinal-Matching Bias in Audio-Visual LLMs

    Sep 28, 2026Jihoo Jung, Youngjoon Jang, Hyebin Cho +2Audio-Visual ReasoningLarge Audio Language Models

  11. Less is More: Encoder-only Audio-Visual Segmentation

    Sep 24, 2026Ilpo Viertola, Vladimir Iashin, Sophie Tötterström +1Video Object SegmentationVision Encoders

  12. OmniEcho: Audio-Visual Spatial Understanding for Omni-Modal Embodied Agents

    Sep 20, 2026Ruixun Liu, Yuxuan Wang, Jiacheng Xie +10Spatial AudioAudio-Visual Reasoning

  13. AVTrace: Diagnosing Audio-Visual Temporal Reasoning in Omni Models

    Sep 17, 2026Longyin Zhang, Parth Sakhare Mahendra, Chengwei Wei +4Audio-Visual ReasoningOmni-Modal

  14. Video-HolmesV2: Can MLLMs Reason with Spatio-Temporal Audio-Visual Evidence in Long Videos?

    Sep 15, 2026Zhaoyang Wei, Zipeng Wang, Yushe Cao +10Audio-Visual ReasoningVideo Understanding

  15. Audio-Visual Turn-taking Prediction in Cocktail Party Scenarios

    Sep 15, 2026Long-Vu Hoang, Naomi HarteTurn-TakingAudio-Visual Reasoning

  16. Omni-Streaming Thinking

    Sep 14, 2026Enjun Du, Siyi Liu, Ziyu Zheng +4Omni-ModalAudio-Visual Reasoning

  17. Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs

    Sep 9, 2026Killian Steunou, Yannis Tevissen, Mounîm A. El YacoubiAudio-Visual ReasoningVision Encoders

  18. Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?

    Aug 13, 2026Koen P. de Vries, Xavier Alameda-Pineda, Estefanía Talavera +1Audio-Visual ReasoningVideo Multimodal Large Language Models

  19. Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

    Aug 10, 2026Zhi Zeng, Cheng Zhang, Zesheng Yang +9Audio-Visual ReasoningSpatial Audio

  20. Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

    Aug 9, 2026Kyeongyoon Lee, Hongyeob Kim, Youngeun Kim +1Audio-Visual ReasoningOmni-Modal

  21. OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

    Aug 4, 2026Wanshun Su, Yang Shi, Feihu Liu +10Token CompressionOmni-Modal

  22. OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

    Jul 21, 2026Yu Chen, Caorui Li, Ziyu Xiong +8Audio-Visual ReasoningOmni-Modal

  23. Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

    Jul 17, 2026Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +19Audio-Visual ReasoningLarge Audio Language Models

  24. AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

    Jul 14, 2026Yanghai Wang, Jiahao Wang, Jiafu Tang +9Audio-Visual ReasoningVideo Captioning

  25. A Hybrid Mamba for Audio-Visual Navigation

    Jul 14, 2026Yi Wang, Yinfeng YuAudio-Visual ReasoningObject Goal Navigation

  26. Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video

    Jul 13, 2026Vikas Kumar, Aditya Mishra, Haroon R. LoneAffective ComputingAudio-Visual Reasoning

  27. Empowering Long-form Omni-modal Understanding with Robust Audio Perception

    Jul 11, 2026Kaiying Yan, Luoyi Sun, Xiao Zhou +1Audio-Visual ReasoningOmni-Modal

  28. Uncovering Latent Depression Severity for Binary Depression Detection via Advantage-weighting Ranking

    Jul 7, 2026Manning Gao, Tingyi Liu, Leheng Zhang +3DepressionMultimodal Deep Learning

  29. Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering

    Jul 4, 2026SungHun Kim, SeungJun BaekAudio-Visual ReasoningCross-Modal Attention

  30. OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

    Jul 3, 2026Shijie Cao, Qingyu Zhang, Boxi Yu +6Token CompressionAudio-Visual Reasoning

  31. C3C^3ASD: Multi-Level Consistency-Driven Representation Learning

    Jul 3, 2026Jin Hong, Jisoo Park, Junseok KwonDiscrete Speech RepresentationsAudio-Visual Reasoning

  32. MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

    Jun 29, 2026Yuxuan Fan, Gyusik Seo, Jing Hao +3Artistic OwnershipAudio-Visual Reasoning

  33. AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

    Jun 23, 2026Yijing Chen, Wenhui Tan, Xiaoyi Yu +7Audio-Visual ReasoningLarge Audio Language Models

  34. Unlocking Spatial Grounding in Large Audio-Visual Retrieval models

    Jun 22, 2026Hugo Malard, Michel Olvera, Sanjeel Parekh +3Audio-Visual ReasoningSound Source Localization

  35. READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations

    Jun 22, 2026Bo Fang, Xinyao Zhang, Yuxin Song +3Audio-Visual ReasoningMultimodal Generation

  36. Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning

    Jun 9, 2026Zihan Meng, Dexiang Hong, Weidong Chen +3Visual Token PruningAudio-Visual Reasoning

  37. Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization

    Jun 5, 2026Zhe Yang, Ruyi Zhang, Hongtao Chen +4Audio-Visual ReasoningFine-Grained Video Understanding

  38. M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

    Jun 4, 2026Fei Su, Cancan Li, Ming Li +1Audio-Visual ReasoningMulti-View

  39. AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

    Jun 1, 2026Yaoting Wang, Ziyi Zhang, Wenming Tu +10Audio-Visual ReasoningMultimodal Benchmarks

  40. AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes

    Jun 1, 2026Yaoting Wang, Yun Zhou, Zipei Zhang +1Audio-Visual ReasoningAutomatic Speaker Verification

  41. Beyond the Mouth: Upper-Face Affective Cues in Audiovisual Sentence Recognition under Acoustic Uncertainty

    May 30, 2026Zhou Yang, Yueyi YangFacial Expression RecognitionAudio-Visual Reasoning

  42. Your Multimodal Speech Model Says I Have a Face for Radio

    May 28, 2026Maya K. Nachesa, Vlad Niculae, Vagrant GautamAudio-Visual Reasoning

  43. Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning

    May 27, 2026Ke Xu, Yuhao Wang, Ziyang Cheng +3Omni-ModalAudio-Visual Reasoning

  44. O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

    May 26, 2026Peiran Wu, Yunze Liu, Chi-Hao Wu +2Audio-Visual ReasoningVideo Understanding

  45. StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering

    May 25, 2026Ming Xie, Zizheng Huang, Xudong Tan +6Streaming Video UnderstandingStreaming Video

  46. LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

    May 21, 2026Yifan Dai, Zhenhua Wu, Bohan Zeng +18Audio-Visual ReasoningOmni-Modal

  47. OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding

    May 18, 2026Ruixiang Zhao, Jie Yang, Zijie Xin +4Omni-ModalAudio-Visual Reasoning

  48. When Vision Speaks for Sound

    May 13, 2026Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu +6Audio-Visual ReasoningVideo Multimodal Large Language Models

  49. OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

    May 12, 2026Yuchen Deng, Zidang Cai, Hai-Tao Zheng +3Token CompressionAudio-Visual Reasoning

  50. Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs

    May 12, 2026Chaeyoung Jung, Kyeongha Rho, Joon Son ChungAudio-Visual ReasoningOmni-Modal

  51. Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

    May 11, 2026Xuanchen Li, Yuheng Lu, Chenrui Cui +6Audio-Visual ReasoningLLM Reasoning Strategies