1 paper
Jiaxiang Liu, Tianxiang Hu, Jiawei Du +3
Visual Language Models such as CLIP excel in image recognition due to extensive image-text pre-training. However, applying the CLIP inference in zero-shot classification, particula…