1 paper · 1 filter
Bin Wang, Wentong Li, Wenqian Wang +3
Recently, large-scale pre-trained vision-language models (e.g., CLIP), have garnered significant attention thanks to their powerful representative capabilities. This inspires resea…