1 paper · 1 filter
Erle Zhu, Yadi Liu, Zhe Zhang +5
Pre-trained on extensive text and image corpora, current Multi-Modal Large Language Models (MLLM) have shown strong capabilities in general visual reasoning tasks. However, their p…