Audio-Visual QA

QA: Question Answering

Momentum

4 papers in the last four weeks, down 20% on the four weeks before. 0.0% of all new papers.

Jul 13Week of Sep 28

Latest papers 19

All topics
CardsList
  1. LEAP: Learned Block-wise Evidence Retrieval for Long Audio-Video Perception

    Sep 30, 2026Juyi Lin, Zhiqiang Lao, Jiali Cui +9Audio-Visual QALong-Video QA

  2. OmniReasoning: Pushing the Limits of Audio-Visual Joint Reasoning

    Sep 30, 2026Junming Lin, Yuxuan Wang, Zhenxin Lei +11On-Policy Self-DistillationMultimodal Reasoning

  3. OP-CAD: On-Policy Clean-Audio Distillation for Robust Audio-Visual Reasoning

    Sep 30, 2026Xingming Shui, Dapeng Chen, Bowei Liu +5Audio-Visual UnderstandingMultimodal Robustness

  4. SyncRA: Learning Temporal Correspondence in Omni-Modal Models

    Sep 28, 2026Zelong Xu, Yan Li, Wenhe Hu +1Audio-Visual Representation LearningAudio-Visual Synchronization

  5. TAKE 85: Testing Audiovisual filmmaKer's intEnt across 85 Hours of Film

    Aug 30, 2026Kaishuu Shinozaki-Conefrey, Olivier Pascaud, Robin Courant +3Audio-Visual UnderstandingVideo-Language Model Evaluation

  6. Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?

    Aug 13, 2026Koen P. de Vries, Xavier Alameda-Pineda, Estefanía Talavera +1Supervised Fine-TuningMultimodal Large Language Models

  7. Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

    Aug 10, 2026Zhi Zeng, Cheng Zhang, Zesheng Yang +9Unified Multimodal ModelsAudio-Visual QA

  8. Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models

    Aug 10, 2026Puneet Mathur, Manan Suri, Dinesh ManochaEfficient Multimodal InferenceMultimodal Memory

  9. Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

    Jul 17, 2026Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +19Audio-Visual UnderstandingMultimodal Large Language Models

  10. Empowering Long-form Omni-modal Understanding with Robust Audio Perception

    Jul 11, 2026Kaiying Yan, Luoyi Sun, Xiao Zhou +1Audio-Visual UnderstandingMultimodal Pretraining

  11. Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering

    Jul 4, 2026SungHun Kim, SeungJun BaekMultimodal QACross-Modal Attention

  12. V-LynX: Token Interface Alignment for Video+X LLMs

    May 30, 2026Jungin Park, Jiyoung Lee, Kwanghoon SohnCross-Modal AlignmentMultimodal QA

  13. O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

    May 26, 2026Peiran Wu, Yunze Liu, Chi-Hao Wu +2Audio-Visual UnderstandingEfficient Multimodal Inference

  14. Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

    May 11, 2026Xuanchen Li, Yuheng Lu, Chenrui Cui +6Cross-Modal LearningMultimodal QA

  15. TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos

    May 8, 2026Hengyi Feng, Hao Liang, Mingrui Chen +6Audio-Visual UnderstandingMultimodal Hallucination

  16. KARMA-MV: A Benchmark for Causal Question Answering on Music Videos

    May 5, 2026Archishman Ghosh, Abhinaba Roy, Dorien HerremansAudio-Visual UnderstandingVideo QA

  17. Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

    Sep 22, 2025Geewook Kim, Minjoon SeoVLM EvaluationAudio-Visual Understanding