1 paper · 1 filter
Yang Qiao, Yuntong Hu, Bowen Zhu +2
Multimodal representation learning has been largely driven by contrastive models such as CLIP, which learn a shared embedding space by aligning paired image-text samples. While eff…