1 paper
Yan Li, Yifei Xing, Xiangyuan Lan +3
Cross-modal alignment is crucial for multimodal representation fusion due to the inherent heterogeneity between modalities. While Transformer-based methods have shown promising res…