1 paper · 1 filter
Xiao Xu, Bei Li, Chenfei Wu +6
Two-Tower Vision-Language (VL) models have shown promising improvements on various downstream VL tasks. Although the most advanced work improves performance by building bridges bet…