1 paper
Navya Gupta, Bingjie Xu, Avinash Anand +2
Compositional visual question answering requires Vision-Language Models (VLMs) to execute multiple reasoning operations like object selection, spatial relation resolution, and attr…