1 paper
Dongfu Jiang, Xuan He, Huaye Zeng +4
Large multimodal models (LMMs) have shown great results in single-image vision language tasks. However, their abilities to solve multi-image visual language tasks is yet to be impr…