1 paper
Jiaxiang Fang, Shiqiang Ma, Jing Wang +3
Large-scale Vision-Language Models like CLIP have demonstrated impressive open-set localization capabilities at the image level. However, adapting this capability to pixel-level de…