1 paper · 1 filter
Jinhao Li, Haopeng Li, Sarah Erfani +3
It has recently been discovered that using a pre-trained vision-language model (VLM), e.g., CLIP, to align a whole query image with several finer text descriptions generated by a l…