1 paper
Siyuan Yang, Jun Liu, Hao Cheng +5
Recent advances in large-scale pretrained vision models have demonstrated impressive capabilities across a wide range of downstream tasks, including cross-modal and multi-modal sce…