1 paper
Thierry Deruyttere, Simon Vandenhende, Dusan Grujicic +5
The task of visual grounding requires locating the most relevant region or object in an image, given a natural language query. So far, progress on this task was mostly measured on…