1 paper
Keita Otani, Tatsuya Harada
Grounding complex, compositional visual queries with multiple objects and relationships is a fundamental challenge for vision-language models. While standard phrase grounding metho…