1 paper · 1 filter
Bin Zhu, Bin Lin, Munan Ning +11
The video-language (VL) pretraining has achieved remarkable improvement in multiple downstream tasks. However, the current VL pretraining framework is hard to extend to multiple mo…