1 paper
Tzu-Jui Julius Wang, Jorma Laaksonen, Tomas Langer +2
Weakly-supervised vision-language (V-L) pre-training (W-VLP) aims at learning cross-modal alignment with little or no paired data, such as aligned images and captions. Recent W-VLP…