1 paper
Mitchell Keren Taraday, Shahaf Wagner, Chaim Baskin
Multimodal retrieval still leans on embedding-based models like CLIP for fast vector search over pre-computed image embeddings. Yet, unlike text retrieval, where joint-encoder rera…