1 paper · 1 filter
Tom Kouwenhoven, Kiana Shahrasbi, Tessa Verhoef
Recent advances in multimodal models have raised questions about whether vision-and-language models (VLMs) integrate cross-modal information in ways that reflect human cognition. O…