1 paper · 1 filter
Changhao Xiang, Shangyu Xing, Zhen Wu +2
Existing Multimodal Large Language Models (MLLMs) predominantly rely on image-text pairs for modality alignment pretraining, mapping global image representations to long textual de…