1 paper · 1 filter
Zhuokai Zhao, Harish Palani, Tianyi Liu +2
Multimodal deep learning, especially vision-language models, have gained significant traction in recent years, greatly improving performance on many downstream tasks, including con…