1 paper · 1 filter
Zhi Zhang, Srishti Yadav, Fengze Han +1
The recent advancements in auto-regressive multimodal large language models (MLLMs) have demonstrated promising progress for vision-language tasks. While there exists a variety of…