1 paper
Mohammad Abuzar Hashemi, Zhanghexuan Li, Mihir Chauhan +5
Pre-training visual and textual representations from large-scale image-text pairs is becoming a standard approach for many downstream vision-language tasks. The transformer-based m…