1 paper
Yifan Li, Shiying Wang, Jianqiang Huang
Vision-Language Pre-training (VLP) models like CLIP have significantly advanced Remote Sensing Image-Text Retrieval (RSITR). However, existing methods predominantly rely on coarse-…