1 paper
Xiaolun Jing, Kezhao Yin, Xinxing Yang +2
With the emergence of large-scale image-text pre-training models, e.g., CLIP, text-video retrieval has experienced substantial advances in recent years. Existing best-performing me…