1 paper · 2 filters
Sunny Gupta, Shounak Das, Amit Sethi
Vision language foundation models such as CLIP exhibit impressive zero-shot generalization yet remain vulnerable to spurious correlations across visual and textual modalities. Exis…