1 paper
Wei Ye, Chaoya Jiang, Haiyang Xu +6
Vision Transformers (ViTs) have become increasingly popular in large-scale Vision and Language Pre-training (VLP) models. Although previous VLP research has demonstrated the effica…