1 paper
Xinyu Mao, Junsi Li, Haoji Zhang +2
Fine-grained cross-modal alignment aims to establish precise local correspondences between vision and language, forming a cornerstone for visual question answering and related mult…