collaborators

5 papers

cs.SD2026

AudioRWKV: Efficient and Stable Bidirectional RWKV for Audio Pattern Recognition

Jing Wang, Maoxiang Wu, Jiayu Xiong +2

Recently, Transformers (e.g., Audio Spectrogram Transformers, AST) and state-space models (e.g., Audio Mamba, AuM) have achieved remarkable progress in audio modeling. However, the…

cs.LG2026

Geometry-based Schrödinger Bridges for Trustworthy Multimodal Fusion

Jiayu Xiong, Jing Wang, Qi Zhang +2

Real-world multimodal systems must be robust against low-quality data, such as sensor noise, incomplete multimodal data and conflicting inputs. However, existing trustworthy fusion…

cs.CV2026

Multimodal Fusion via Self-Consistent Task-Gradient Fields

Jiayu Xiong, Jing Wang, Jun Xue +4

Multimodal learning aims to preserve as much task-related information as possible from different inputs. However, current fusion designs often distort the feedback loop to feature…

cs.CV2026

Inconsistency-aware Multimodal Schrödinger Bridge for Deepfake Localization

Jiayu Xiong, Jing Wang, Qi Zhang +2

Audio-visual deepfake localization demands interval-level outputs that serve as temporal evidence. Despite recent progress, symmetric fusion under single-sided or asynchronous forg…

cs.MM2025

Cross-Space Synergy: A Unified Framework for Multimodal Emotion Recognition in Conversation

Xiaosen Lyu, Jiayu Xiong, Yuren Chen +3

Multimodal Emotion Recognition in Conversation (MERC) aims to predict speakers' emotions by integrating textual, acoustic, and visual cues. Existing approaches either struggle to c…