1 paper · 1 filter
Xuanchen Li, Yuheng Lu, Chenrui Cui +6
Audio and vision provide complementary evidence for audio-visual question answering, yet current audio-visual large language models may suffer from cross-modal interference: inform…