1 paper
Thanh Hieu Cao, Trung Khang Tran, Gia Thinh Pham +2
Recent advancements in large-scale pretraining in natural language processing have enabled pretrained vision-language models such as CLIP to effectively align images and text, sign…