3 papers
cs.MM2026
Catalogue Grounded Multimodal Attribution for Museum Video under Resource and Regulatory Constraints
Minsak Nanang, Adrian Hilton, Armin Mustafa
Audiovisual (AV) archives in museums and galleries are growing rapidly, but much of this material remains effectively locked away because it lacks consistent, searchable metadata.…
cs.CV2024
Efficient Audio-Visual Fusion for Video Classification
Mahrukh Awan, Asmar Nadeem, Armin Mustafa
We present Attend-Fusion, a novel and efficient approach for audio-visual fusion in video classification tasks. Our method addresses the challenge of exploiting both audio and visu…
cs.CV2024
Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification
Mahrukh Awan, Asmar Nadeem, Muhammad Junaid Awan +2
Exploiting both audio and visual modalities for video classification is a challenging task, as the existing methods require large model architectures, leading to high computational…