1 paper
Zirui Li, Siwei Wu, Yizhi Li +3
The rapid advancement of unsupervised representation learning and large-scale pre-trained vision-language models has significantly improved cross-modal retrieval tasks. However, ex…