1 paper
Zonglin Yang, Huilan Ma, Xudan Zheng +1
Vision-language models such as CLIP embed images and text in a shared space, where modality-specific distributions often remain separated. Existing accounts connect this modality g…