1 paper
Jiale Liu, Haoming Zhou, Yishu Liu +2
Fine-grained image-text alignment is a pivotal challenge in multimodal learning, underpinning key applications such as visual question answering, image captioning, and vision-langu…