3 papers
cs.AI2026
Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization
Zhe Yang, Ruyi Zhang, Hongtao Chen +4
Open-vocabulary audio-visual event localization (OV-AVEL) jointly models audio-visual cues to recognize and temporally localize events, including categories unseen during training.…
cs.LG2025
Adaptive Redundancy Regulation for Balanced Multimodal Information Refinement
Zhe Yang, Wenrui Li, Hongtao Chen +3
Multimodal learning aims to improve performance by leveraging data from multiple sources. During joint multimodal training, due to modality bias, the advantaged modality often domi…
cs.CV2024
Hyperbolic-constraint Point Cloud Reconstruction from Single RGB-D Images
Wenrui Li, Zhe Yang, Wei Han +3
Reconstructing desired objects and scenes has long been a primary goal in 3D computer vision. Single-view point cloud reconstruction has become a popular technique due to its low c…