1 paper
Jill P. Naiman, Daniel J. Evans, JooYoung Seo
Visual Question Answering (VQA) has become an important benchmark for assessing how large multimodal models (LMMs) interpret images. However, most VQA datasets focus on real-world…