1 paper
Rintaro Otsubo, Ryo Fujii, Reina Ishikawa +6
Vision-Language Models (VLMs) have demonstrated immense promise in Spatio-Temporal Video Grounding (STVG). However, current evaluation protocols are largely confined to zero-shot a…