1 paper · 1 filter
Navya Gupta, Bingjie Xu, Avinash Anand +2
Compositional visual question answering requires Vision-Language Models (VLMs) to execute multiple reasoning operations like object selection, spatial relation resolution, and attr…