1 paper · 1 filter
Yichen Shi, Yuhao Gao, Yingxin Lai +7
Multimodal large language models (MLLMs) have demonstrated strong capabilities in vision-related tasks, capitalizing on their visual semantic comprehension and reasoning capabiliti…