1 paper
Maan Qraitem, Piotr Teterwak, Kate Saenko +1
Vision-language models (VLMs) (e.g. CLIP, LLaVA) are trained on large-scale, lightly curated web datasets, leading them to learn unintended correlations between semantic concepts a…