1 paper
Chan Hur, SeungWoo Song, Jeong-hun Hong +3
Existing text-video retrieval datasets primarily consist of short-form clips containing a single dominant event. While suitable for measuring basic vision-language alignment, they…