1 paper
Hector G. Rodriguez, Marcus Rohrbach
Multimodal large language models (MLLMs) achieve ever-stronger performance on visual-language tasks. Even as traditional visual question answering (VQA) benchmarks approach saturat…