1 paper
Wenyi Zhang, Ju Jia, Xiaojun Jia +4
The multimodal datasets can be leveraged to pre-train large-scale vision-language models by providing cross-modal semantics. Current endeavors for determining the usage of datasets…