1 paper
Zongshang Pang, Mayu Otani, Yuta Nakashima
Temporally localizing user-queried events through natural language is a crucial capability for video models. Recent methods predominantly adapt video LLMs to generate event boundar…