1 paper
Kaiying Yan, Luoyi Sun, Xiao Zhou +1
Recent advances in large-scale multimodal models have drivenremarkable progress in vision-language tasks; however, comprehensiveomni-modal understanding remains under-explored, lar…