1 paper · 1 filter
Mohammad Abuzar Hashemi, Zhanghexuan Li, Mihir Chauhan +5
Pre-training visual and textual representations from large-scale image-text pairs is becoming a standard approach for many downstream vision-language tasks. The transformer-based m…