1 paper · 1 filter
Xingjun Ma, Hanxun Huang, Tianwei Song +3
Large-scale pre-training frameworks like CLIP have revolutionized multimodal learning, but their reliance on web-scraped datasets, frequently containing private user data, raises s…