1 paper
Xiaochen Wang, Heming Xia, Jialin Song +9
Large Multimodal Models (LMMs) have achieved remarkable success across various visual-language tasks. However, existing benchmarks predominantly focus on single-image understanding…