1 paper
Jiangnan Xie, Xiaolong Zheng, Liang Zheng
Visual Grounding (VG) aims to utilize given natural language queries to locate specific target objects within images. While current transformer-based approaches demonstrate strong…