1 paper
Ziping Ma, Furong Xu, Jian Liu +2
Multimodal alignment between language and vision is the fundamental topic in current vision-language model research. Contrastive Captioners (CoCa), as a representative method, inte…