1 paper · 1 filter
Yueyi Sun, Yuhao Wang, Jason Li +8
Multimodal large language models (MLLMs) have achieved remarkable progress in visual understanding tasks. However, most existing MLLMs rely on autoregressive generation, which limi…