4 papers
AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation
Yuxin Lu, Jiayang Sun, Guibo Zhu +1
Diffusion-based talking head generation has achieved remarkable visual quality, yet scaling it to long-term videos remains challenging. The widely adopted chunk-wise paradigm intro…
Mamba: CLIP-driven Mamba Model for Multi-modal Remote Sensing Classification
Mingxiang Cao, Weiying Xie, Xin Zhang +4
Multi-modal fusion holds great promise for integrating information from different modalities. However, due to a lack of consideration for modal consistency, existing multi-modal fu…
DiffCLIP: Few-shot Language-driven Multimodal Classifier
Jiaqing Zhang, Mingxiang Cao, Xue Yang +2
Visual language models like Contrastive Language-Image Pretraining (CLIP) have shown impressive performance in analyzing natural images with language information. However, these mo…
FusionSAM: Visual Multi-Modal Learning with Segment Anything
Daixun Li, Weiying Xie, Mingxiang Cao +5
Multimodal image fusion and semantic segmentation are critical for autonomous driving. Despite advancements, current models often struggle with segmenting densely packed elements d…