1 paper
Hong Gao, Jingyu Wu, Xiangkai Xu +5
Spatio-Temporal Video Grounding (STVG) aims to localize target objects in videos based on natural language descriptions. Despite recent advances in Multimodal Large Language Models…