1 paper · 1 filter
Yunkai Dang, Mengxi Gao, Yibo Yan +8
Multimodal large language models (MLLMs) have recently achieved state-of-the-art performance on tasks ranging from visual question answering to video understanding. However, existi…