2 papers
cs.CV2024
Disentangle and denoise: Tackling context misalignment for video moment retrieval
Kaijing Ma, Han Fang, Xianghao Zang +7
Video Moment Retrieval, which aims to locate in-context video moments according to a natural language query, is an essential task for cross-modal grounding. Existing methods focus…
cs.CV2023
Mask to reconstruct: Cooperative Semantics Completion for Video-text Retrieval
Han Fang, Zhifei Yang, Xianghao Zang +2
Recently, masked video modeling has been widely explored and significantly improved the model's understanding ability of visual regions at a local level. However, existing methods…