1 paper
Weihan Wang, Zhen Yang, Bin Xu +2
Vision-language pre-training (VLP) methods are blossoming recently, and its crucial goal is to jointly learn visual and textual features via a transformer-based architecture, demon…