4 papers
Geometry-based Schrödinger Bridges for Trustworthy Multimodal Fusion
Jiayu Xiong, Jing Wang, Qi Zhang +2
Real-world multimodal systems must be robust against low-quality data, such as sensor noise, incomplete multimodal data and conflicting inputs. However, existing trustworthy fusion…
Multimodal Fusion via Self-Consistent Task-Gradient Fields
Jiayu Xiong, Jing Wang, Jun Xue +4
Multimodal learning aims to preserve as much task-related information as possible from different inputs. However, current fusion designs often distort the feedback loop to feature…
Inconsistency-aware Multimodal Schrödinger Bridge for Deepfake Localization
Jiayu Xiong, Jing Wang, Qi Zhang +2
Audio-visual deepfake localization demands interval-level outputs that serve as temporal evidence. Despite recent progress, symmetric fusion under single-sided or asynchronous forg…
Cross-Space Synergy: A Unified Framework for Multimodal Emotion Recognition in Conversation
Xiaosen Lyu, Jiayu Xiong, Yuren Chen +3
Multimodal Emotion Recognition in Conversation (MERC) aims to predict speakers' emotions by integrating textual, acoustic, and visual cues. Existing approaches either struggle to c…