1 paper · 1 filter
Wei Jia, Zhicong Lu, Yu Chen +5
Large vision-language models (LVLMs) have achieved substantial performance gains in Video Temporal Grounding (VTG) through reinforcement learning (RL). However, existing methods pr…