2 papers
cs.SD2026
AudioRWKV: Efficient and Stable Bidirectional RWKV for Audio Pattern Recognition
Jing Wang, Maoxiang Wu, Jiayu Xiong +2
Recently, Transformers (e.g., Audio Spectrogram Transformers, AST) and state-space models (e.g., Audio Mamba, AuM) have achieved remarkable progress in audio modeling. However, the…
cs.CV2026
Multimodal Fusion via Self-Consistent Task-Gradient Fields
Jiayu Xiong, Jing Wang, Jun Xue +4
Multimodal learning aims to preserve as much task-related information as possible from different inputs. However, current fusion designs often distort the feedback loop to feature…