1 paper · 1 filter
Fabian Morelli, Arnas Uselis, Ankit Sonthalia +1
Large-scale pre-trained vision-language models like CLIP demonstrate remarkable zero-shot performance across diverse tasks. However, fine-tuning these models to improve downstream…