1 paper · 1 filter
Yujin Jo, Taesup Kim
Pre-trained vision-language models (VLMs), such as CLIP, have demonstrated remarkable zero-shot generalization, enabling deployment in a wide range of real-world tasks without addi…