1 paper · 1 filter
Xuefeng Hu, Ke Zhang, Lu Xia +9
Large-scale Pre-Training Vision-Language Model such as CLIP has demonstrated outstanding performance in zero-shot classification, e.g. achieving 76.3% top-1 accuracy on ImageNet wi…