1 paper
Yongwei Che, Benjamin Eysenbach
While internet-scale data often comes in pairs (e.g., audio/image, image/text), we often want to perform inferences over modalities unseen together in the training data (e.g., audi…