1 paper · 1 filter
Muhammad Waleed Gondal, Jochen Gast, Inigo Alonso Ruiz +4
Large vision-language representation learning models like CLIP have demonstrated impressive performance for zero-shot transfer to downstream tasks while largely benefiting from int…