1 paper · 1 filter
Qizhou Wang, Yong Lin, Yongqiang Chen +3
Large vision language models, such as CLIP, demonstrate impressive robustness to spurious features than single-modal models trained on ImageNet. However, existing test datasets are…