1 paper
Muhammad Waleed Gondal, Jochen Gast, Inigo Alonso Ruiz +4
Large vision-language representation learning models like CLIP have demonstrated impressive performance for zero-shot transfer to downstream tasks while largely benefiting from int…