1 paper
Hao Tan, Jun Li, Yizhuang Zhou +3
Vision-Language Models (VLMs) such as CLIP have demonstrated remarkable generalization capabilities to downstream tasks. However, existing prompt tuning based frameworks need to pa…