1 paper
Rong Fan, Kaiyan Xiao, Minghao Zhu +3
Video temporal grounding (VTG) is a critical task in video understanding and a key capability for extending video large language models (Vid-LLMs) to broader applications. However,…