1 paper · 1 filter
Junhyeok Choi, Sangwoo Mo, Minwoo Chae
Recent advances in multimodal learning have achieved remarkable success across diverse vision-language tasks. However, such progress heavily relies on large-scale image-text datase…