1 paper
Bijay Gurung, David T. Hoffmann, Thomas Brox
Contrastive vision-language models like CLIP are used for a large variety of applications, such as zero-shot classification or as vision encoder for multi-modal models. Despite the…