3 papers
cs.AI2026
Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization
Zhe Yang, Ruyi Zhang, Hongtao Chen +4
Open-vocabulary audio-visual event localization (OV-AVEL) jointly models audio-visual cues to recognize and temporally localize events, including categories unseen during training.…
cs.CV2026
All-in-One Video Restoration under Smoothly Evolving Unknown Weather Degradations
Wenrui Li, Hongtao Chen, Yao Xiao +4
All-in-one image restoration aims to recover clean images from diverse unknown degradations using a single model. But extending this task to videos faces unique challenges. Existin…
cs.LG2025
Adaptive Redundancy Regulation for Balanced Multimodal Information Refinement
Zhe Yang, Wenrui Li, Hongtao Chen +3
Multimodal learning aims to improve performance by leveraging data from multiple sources. During joint multimodal training, due to modality bias, the advantaged modality often domi…