1 paper
Gengtian Shi, Jinze Yu, Chenhao Wu +5
Video-text temporal localization requires precise alignment between natural language queries and corresponding video segments, a fundamental challenge in multimodal understanding.…