2 papers
cs.CV2026
MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion
Yunzhan Fu, Xiangyu Shen, Yifei Sun +3
Medical image fusion aims to integrate complementary information from diverse imaging modalities to support clinical diagnosis. Existing methods typically apply uniform fusion rule…
cs.CV2026
SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation
Yunzhan Fu, Enyu Bao, Xiangyu Shen +4
Vision-language pre-training (VLP) serves as a cornerstone for medical multimodal representation learning. However, existing medical VLP frameworks are often constrained by the lim…