cs.SDOct 8, 2026

Selective Listening: Mechanism-Guided Control of Audio Influence in Large Audio-Language Models

Authors: Yulin Sun, Kele Xu, Yong Dou

Organizations: College of Computer Science and Technology, National University of Defense Technology · State Key Laboratory of Complex & Critical Software Environment

Abstract

Large audio-language models (LALMs) exploit multimodal evidence, yet task-irrelevant audio can alter text-reasoning decisions when listening is unnecessary. Aggregate Accuracy can hide this paired drift because audio-induced repairs and damages may cancel. Paired drift analysis and targeted interventions identify architecture-specific, intervention-sensitive late audio pathways as actionable control points. We introduce ICAP-Gate, which applies mechanism-guided, task-conditioned control to each model's pathway. Across four LALMs, two reasoning benchmarks, and environmental-sound and natural-speech interference, ICAP-Gate has lower point estimates for Influence Rate and Answer Flip than ungated inference in all 16 full-split model--condition evaluations. Fixed suppression degrades automatic speech recognition (ASR) across all four models, whereas ICAP-Gate matches ungated ASR performance by preserving the pathway for explicit audio-demand instructions. ICAP-Gate has lower paired-drift point estimates than mitigation prompting in all four evaluated settings and provides competitive stabilization relative to eight-sample Self-Consistency while using one generation per query; in controlled ARC measurements, Self-Consistency incurs 7.07.0--9.2×9.2\times ungated latency. These results establish selective modality influence control as a design principle for robust multimodal reasoning.

Figures & tables

Appendix figures & tables14 assets

Supplementary material from the paper’s appendix.

Appendix

Explore similar work

CardsList
  1. Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models

    Jun 3, 2026Yichen Gao, Yiqun Zhang, Zijing Wang +7Audio-Language Model EvaluationAudio Understanding

  2. Beyond Accuracy: ARIA-Rubrics for Evaluating Audio Reasoning in Large Audio Language Models

    Sep 9, 2026Yupei Li, Qiyang Sun, Mohamed Mady +4Audio-Language Model EvaluationAudio Reasoning

  3. Listen-to-Reason: Listen with Experts, Retrieve over a Graph, Reason with LLMs

    Oct 7, 2026Pooneh Mousavi, Mirco Ravanelli, Cem SubakanAudio-Language ModelsAudio Reasoning