1 paper
Ke Fan, Zechen Bai, Tianjun Xiao +11
In this paper, we show that recent advances in video representation learning and pre-trained vision-language models allow for substantial improvements in self-supervised video obje…