1 paper
Zicheng Zhang, Tong Zhang, Yi Zhu +4
The pre-trained vision-language model, exemplified by CLIP, advances zero-shot semantic segmentation by aligning visual features with class embeddings through a transformer decoder…