1 paper
Jingru Yi, Burak Uzkent, Oana Ignat +4
Grounding-based vision and language models have been successfully applied to low-level vision tasks, aiming to precisely locate objects referred in captions. The effectiveness of g…