1 paper
Eleonora Grassucci, Giordano Cicchetti, Emanuele Frasca +2
In multimodal learning, CLIP has been recognized as the \textit{de facto} method for learning a shared latent space across multiple modalities, placing similar representations clos…