1 paper
Minghang Zheng, Jingli Wei, Hongyi Yang +1
Video Temporal Grounding (VTG) faces significant challenges when natural language queries must distinguish between multiple events involving visually similar entities, particularly…