1 paper
Jiacheng Chen, Hexiang Hu, Hao Wu +2
Visual Semantic Embedding (VSE) is a dominant approach for vision-language retrieval, which aims at learning a deep embedding space such that visual data are embedded close to thei…