1 paper · 1 filter
Jia Chengyu, AprilPyone MaungMaung, Huy H. Nguyen +2
Recent advances in vision-language models (VLMs) trained on web-scale image-text pairs have enabled impressive zero-shot transfer across a diverse range of visual tasks. However, c…