Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization
Zhe Yang, Ruyi Zhang, Hongtao Chen +4
Open-vocabulary audio-visual event localization (OV-AVEL) jointly models audio-visual cues to recognize and temporally localize events, including categories unseen during training.…
cs.AI2024
SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering
Zhe Yang, Wenrui Li, Guanghui Cheng
The Audio-Visual Question Answering (AVQA) task holds significant potential for applications. Compared to traditional unimodal approaches, the multi-modal input of AVQA makes featu…