1 paper
Bikang Pan, Qun Li, Xiaoying Tang +6
The emergence of vision-language foundation models, such as CLIP, has revolutionized image-text representation, enabling a broad range of applications via prompt learning. Despite…