1 paper
Yizhou Wang, Song Mao, Yang Chen +8
Recent multimodal large language models (MLLMs) increasingly integrate multiple vision encoders to improve performance on various benchmarks, assuming that diverse pretraining obje…