1 paper
Yifan Jiang, Ruoxi Ning, Sheng Yao +1
Visual inputs are often assumed to improve language understanding in multimodal models. We examine this assumption by asking whether vision-language models (VLMs) can distinguish u…