1 paper
Yichen Shi, Yuhao Gao, Yingxin Lai +7
Multimodal large language models (MLLMs) have demonstrated strong capabilities in vision-related tasks, capitalizing on their visual semantic comprehension and reasoning capabiliti…