1 paper
Tianyi Zhao, Jiawen Xi, Linhui Xiao +4
Visual grounding (VG) localizes target objects in an image from natural-language expressions. In real-world perception, RGB cues often degrade under low illumination and adverse we…