1 paper · 1 filter
Boyu Jia, Junzhe Zhang, Huixuan Zhang +1
In recent years, multimodal large language models (MLLMs) have achieved significant breakthroughs, enhancing understanding across text and vision. However, current MLLMs still face…