1 paper
Yunheng Li, ZhongYu Li, Quansheng Zeng +2
Pre-trained vision-language models, e.g., CLIP, have been successfully applied to zero-shot semantic segmentation. Existing CLIP-based approaches primarily utilize visual features…