1 paper
Qizhou Wang, Yong Lin, Yongqiang Chen +3
Large vision language models, such as CLIP, demonstrate impressive robustness to spurious features than single-modal models trained on ImageNet. However, existing test datasets are…